Gør en scannet PDF søgbar med NAPS2, og kontrollér OCR-teksten

En scanning kan se læsbar ud uden at indeholde søgbar tekst. NAPS2 kan tilføje genkendt tekst til sådanne PDF-sider. Billedet alene beviser ikke, at navne, tal eller læserækkefølge er genkendt korrekt.

Bevar originalen og kontrollér sider

Arbejd med en kopi, og bevar den oprindelige PDF. Importér kopien i NAPS2. Kontrollér sideantal, rækkefølge og retning. Ved afskårne linjer, kraftige skygger eller slørede tegn hjælper en bedre scanning ofte mere end endnu en OCR-kørsel. Vejledningen gælder scanninger, ikke bevarelse af interaktive formularer eller digitale signaturer.

Indstil OCR og gem PDF

  1. Åbn OCR-knappen i NAPS2; på Mac angiver dokumentationen Tools, OCR.
  2. Hent det nødvendige sprog ved første brug. Vælg dokumentets sprog, ikke automatisk brugerfladens.
  3. Aktivér indstillingen, der gør PDF-filer søgbare med OCR. Hent sprogpakker og vælg flere sprog ved flersprogede dokumenter.
  4. Gem en ny PDF med et tydeligt andet navn. Overskriv ikke originalen; vent til genkendelse og lagring er afsluttet.

NAPS2 kører normalt OCR under lagring. Best kan give bedre resultater end Fast, men tager længere tid. Hvidbalance- og støjindstillinger kan hjælpe dårlige scanninger; kontrollér stadig resultatet.

Læs det gemte resultat

Luk den gemte PDF, og åbn netop den fil i en PDF-læser. Søg efter et karakteristisk ord på en tidlig og en sen side. Kopiér et afsnit til en lokal teksteditor, og sammenlign med billedet.

Kontrollér især navne, æ/ø/å, datoer, decimaltegn og forvekslinger som O/0 og I/1. Kontrollér rækkefølgen i spalter og tabeller. Vigtige beløb eller identifikatorer kræver fuld kontrol; stikprøver bekræfter ikke alle sider. Et søgefund beviser kun det pågældende fund.

Eksisterende tekst og grænser

Ifølge dokumentationen lader NAPS2 importerede sider med eksisterende tekst være og bruger OCR på sider uden tekst. Genimport retter derfor ikke automatisk et forkert eksisterende tekstlag. Afklar, hvilke sider der faktisk kun er billeder, frem for gentagen behandling.

OCR oversætter ikke og gør ikke automatisk PDF-filen tilgængelig eller teksten korrekt formateret. NAPS2 eksporterer ikke OCR-resultater direkte til tekstfiler; den dokumenterede vej er at gemme PDF og kopiere i læseren. Bevar originalen, og dokumentér uløste fejl før deling.

Kilde

NAPS2: OCR documentation