Gjør en skannet PDF søkbar med NAPS2 og kontroller OCR-teksten

En skanning kan se lesbar ut uten å inneholde søkbar tekst. NAPS2 kan legge til gjenkjent tekst på slike PDF-sider. Bildet alene beviser ikke at navn, tall eller leserekkefølge er gjenkjent riktig.

Behold originalen og kontroller sidene

Arbeid med en kopi og behold original-PDF-en. Importer kopien i NAPS2. Kontroller antall sider, rekkefølge og retning. Ved avkuttede linjer, sterke skygger eller uskarpe tegn hjelper en bedre skanning ofte mer enn en ny OCR-runde. Veiledningen gjelder skanninger, ikke bevaring av interaktive skjemaer eller digitale signaturer.

Still inn OCR og lagre PDF

  1. Åpne OCR-knappen i NAPS2; på Mac angir dokumentasjonen Tools, OCR.
  2. Last ned nødvendig språk ved første bruk. Velg dokumentets språk, ikke automatisk språket i grensesnittet.
  3. Aktiver valget som gjør PDF-er søkbare med OCR. Last ned språkpakker og velg flere språk for flerspråklige dokumenter.
  4. Lagre en ny PDF med tydelig forskjellig navn. Ikke overskriv originalen; vent til gjenkjenning og lagring er ferdig.

NAPS2 kjører vanligvis OCR under lagring. Best kan gi bedre resultater enn Fast, men tar lengre tid. Hvitbalanse- og støyvalg kan hjelpe svake skanninger; kontroller fortsatt resultatet.

Les det lagrede resultatet

Lukk den lagrede PDF-en og åpne nettopp den filen i en PDF-leser. Søk etter et særpreget ord på en tidlig og en sen side. Kopier et avsnitt til en lokal teksteditor og sammenlign med bildet.

Kontroller særlig navn, æ/ø/å, datoer, desimaltegn og forvekslinger som O/0 og I/1. Kontroller rekkefølgen i spalter og tabeller. Viktige beløp eller identifikatorer krever full kontroll; stikkprøver bekrefter ikke alle sider. Et søketreff beviser bare det aktuelle treffet.

Eksisterende tekst og grenser

Dokumentasjonen sier at NAPS2 lar importerte sider med eksisterende tekst være urørt og bruker OCR på sider uten tekst. Ny import retter derfor ikke automatisk et eksisterende feil tekstlag. Avklar hvilke sider som faktisk bare er bilder, fremfor gjentatt behandling.

OCR oversetter ikke og gjør ikke automatisk PDF-en tilgjengelig eller teksten riktig formatert. NAPS2 eksporterer ikke OCR-resultater direkte til tekstfiler; dokumentert fremgangsmåte er å lagre PDF og kopiere i leseren. Behold originalen og dokumenter uløste feil før deling.

Kilde

NAPS2: OCR documentation