Rendre un PDF numérisé recherchable avec NAPS2 et vérifier le texte

Un scan peut paraître lisible sans contenir de texte recherchable. NAPS2 peut ajouter du texte reconnu à ces pages PDF. L’image seule ne prouve pas la reconnaissance correcte des noms, nombres ou de l’ordre de lecture.

Garder l’original et vérifier les pages

Travaillez sur une copie et préservez le PDF original. Importez la copie dans NAPS2. Vérifiez nombre, ordre et orientation des pages. Pour des lignes coupées, ombres fortes ou caractères flous, un meilleur scan aide souvent plus qu’un nouvel OCR. Ce guide concerne les scans, pas la préservation des formulaires interactifs ou signatures numériques.

Régler l’OCR et enregistrer le PDF

  1. Ouvrez le bouton OCR dans NAPS2 ; sur Mac, la documentation indique Tools, OCR.
  2. Au premier usage, téléchargez la langue nécessaire. Choisissez la langue du document, pas automatiquement celle de l’interface.
  3. Activez l’option rendant les PDF recherchables par OCR. Pour plusieurs langues, téléchargez les modules et sélectionnez les langues du document.
  4. Enregistrez un nouveau PDF sous un nom distinct. Ne remplacez pas l’original ; attendez la fin de la reconnaissance et de l’enregistrement.

NAPS2 effectue normalement l’OCR à l’enregistrement. Best peut améliorer les résultats par rapport à Fast, mais prend plus de temps. Les options de balance des blancs et de bruit peuvent aider les scans médiocres ; vérifiez toujours le résultat.

Relire le résultat enregistré

Fermez le PDF enregistré puis ouvrez exactement ce fichier dans un lecteur PDF. Recherchez un mot distinctif sur une page du début et une de la fin. Copiez un paragraphe dans un éditeur de texte local et comparez-le à l’image.

Contrôlez particulièrement noms, accents, dates, séparateurs décimaux et confusions O/0 ou I/1. Vérifiez l’ordre des colonnes et tableaux. Les montants ou identifiants importants nécessitent un contrôle complet ; des échantillons ne valident pas toutes les pages. Un résultat de recherche prouve uniquement cette occurrence.

Texte existant et limites

La documentation précise que NAPS2 laisse inchangées les pages importées contenant déjà du texte et utilise l’OCR sur celles sans texte. Réimporter ne corrige donc pas automatiquement une couche textuelle erronée existante. Identifiez les pages réellement constituées seulement d’images plutôt que de retraiter le même fichier.

L’OCR ne traduit pas et ne rend pas automatiquement le PDF accessible ni le texte correctement mis en forme. NAPS2 n’exporte pas directement l’OCR en fichier texte ; la voie documentée passe par le PDF enregistré et la copie dans un lecteur. Gardez l’original et documentez les erreurs non résolues avant partage.

Source

NAPS2: OCR documentation