Rendere ricercabile un PDF scansionato con NAPS2 e verificare il testo

Una scansione può apparire leggibile senza contenere testo ricercabile. NAPS2 può aggiungere testo riconosciuto a queste pagine PDF. L’immagine da sola non dimostra il corretto riconoscimento di nomi, numeri o ordine di lettura.

Conservare l’originale e verificare le pagine

Lavorare su una copia e preservare il PDF originale. Importare la copia in NAPS2. Controllare numero, ordine e orientamento delle pagine. Con righe tagliate, ombre forti o caratteri sfocati, una scansione migliore spesso aiuta più di un altro OCR. Questa guida riguarda scansioni, non la conservazione di moduli interattivi o firme digitali.

Impostare OCR e salvare PDF

  1. Aprire il pulsante OCR di NAPS2; su Mac la documentazione indica Tools, OCR.
  2. Al primo utilizzo scaricare la lingua necessaria. Scegliere quella del documento, non automaticamente quella dell’interfaccia.
  3. Attivare l’opzione per rendere ricercabili i PDF tramite OCR. Per documenti multilingue scaricare i pacchetti e selezionare più lingue.
  4. Salvare un nuovo PDF con nome distinguibile. Non sovrascrivere l’originale; attendere la fine di riconoscimento e salvataggio.

NAPS2 normalmente esegue OCR durante il salvataggio. Best può migliorare i risultati rispetto a Fast ma richiede più tempo. Le opzioni per bilanciamento del bianco e rumore possono aiutare scansioni scadenti; controllare comunque il risultato.

Rileggere il risultato salvato

Chiudere il PDF salvato e aprire proprio quel file in un lettore PDF. Cercare una parola distintiva su una pagina iniziale e una finale. Copiare un paragrafo in un editor di testo locale e confrontarlo con l’immagine.

Verificare soprattutto nomi, accenti, date, separatori decimali e confusioni O/0 o I/1. Controllare l’ordine di colonne e tabelle. Importi e identificativi importanti richiedono verifica completa; i campioni non confermano tutte le pagine. Un risultato di ricerca prova solo quella corrispondenza.

Testo esistente e limiti

La documentazione indica che NAPS2 lascia invariate le pagine importate con testo già presente e usa OCR su quelle senza testo. Reimportare non corregge automaticamente un livello testuale errato esistente. Individuare le pagine composte davvero solo da immagini invece di elaborare ripetutamente lo stesso file.

OCR non traduce né rende automaticamente il PDF accessibile o il testo correttamente formattato. NAPS2 non esporta direttamente i risultati OCR in testo; il percorso documentato passa dal PDF salvato e dalla copia nel lettore. Conservare l’originale e documentare gli errori irrisolti prima della condivisione.

Fonte

NAPS2: OCR documentation