Scan-PDF mit NAPS2 durchsuchbar machen und OCR-Text prüfen
Ein Scan kann gut lesbar aussehen und trotzdem keinen durchsuchbaren Text enthalten. NAPS2 kann solchen PDF-Seiten eine erkannte Textebene hinzufügen. Die Bildansicht allein beweist jedoch nicht, dass Namen, Zahlen oder die Lesereihenfolge korrekt erkannt wurden.
Original behalten und Seiten prüfen
Arbeite mit einer Kopie und bewahre das ursprüngliche PDF unverändert auf. Importiere die Kopie in NAPS2. Kontrolliere Seitenzahl, Reihenfolge und Ausrichtung. Bei abgeschnittenen Zeilen, starken Schatten oder unscharfen Zeichen verbessert ein neuer Scan häufig mehr als eine weitere OCR-Runde. Diese Anleitung ist für gescannte Dokumente gedacht, nicht zum Erhalt interaktiver Formularfunktionen oder digitaler Signaturen.
OCR einstellen und als PDF speichern
- Öffne in NAPS2 die Schaltfläche OCR; auf dem Mac liegt sie laut Dokumentation unter Werkzeuge beziehungsweise Tools, OCR.
- Lade beim ersten Einsatz die benötigte Erkennungssprache herunter. Wähle die Sprache des Dokuments, nicht automatisch die Sprache der Bedienoberfläche.
- Aktiviere die Option, PDFs mit OCR durchsuchbar zu machen. Bei mehreren Dokumentsprachen kannst du nach dem Download der Sprachpakete mehrere Sprachen auswählen.
- Speichere als neue PDF mit unterscheidbarem Namen. Überschreibe das Original nicht und warte, bis Erkennung und Speichern abgeschlossen sind.
NAPS2 führt die Erkennung normalerweise beim Speichern aus. Der Modus „Best“ kann bessere Ergebnisse liefern als „Fast“, benötigt aber mehr Zeit. Die Optionen für Weißabgleich und Rauschen können bei schwachen Scans helfen; kontrolliere das Ergebnis trotzdem.
Gespeichertes Ergebnis gegenlesen
Schließe die gespeicherte PDF und öffne genau diese Datei in einem PDF-Betrachter. Suche nach einem markanten Wort auf einer frühen und einer späten Seite. Markiere einen Absatz und kopiere ihn in einen lokalen Texteditor. Vergleiche den kopierten Text mit dem sichtbaren Scan.
Prüfe besonders Namen, Umlaute, Datumsangaben, Dezimalzeichen sowie Verwechslungen wie O/0 und I/1. Kontrolliere bei Spalten und Tabellen die Reihenfolge. Wichtige Beträge oder Kennungen müssen vollständig geprüft werden; Stichproben bestätigen nicht jede Seite. Eine gefundene Suchstelle beweist nur diesen Treffer.
Vorhandener Text und Grenzen
Bei importierten PDFs lässt NAPS2 laut Dokumentation Seiten mit vorhandenem Text unverändert und verwendet OCR für Seiten ohne Text. Ein erneuter Import korrigiert deshalb eine schon vorhandene falsche Textebene nicht automatisch. Kläre zunächst, welche Seiten tatsächlich Bildseiten sind, statt wiederholt dieselbe Datei zu verarbeiten.
OCR übersetzt nicht und macht eine PDF nicht automatisch barrierefrei oder zu einer korrekt formatierten Textdatei. NAPS2 exportiert OCR-Ergebnisse nicht direkt als Textdatei; der dokumentierte Weg führt über die gespeicherte PDF und Kopieren im Betrachter. Behalte das Original und dokumentiere ungeklärte Erkennungsfehler vor der Weitergabe.
