Tornar um PDF digitalizado pesquisável com NAPS2 e verificar o texto

Uma digitalização pode parecer legível e não conter texto pesquisável. O NAPS2 pode acrescentar texto reconhecido a essas páginas PDF. A imagem, por si só, não prova o reconhecimento correto de nomes, números ou ordem de leitura.

Preservar o original e verificar páginas

Trabalhe numa cópia e preserve o PDF original. Importe a cópia no NAPS2. Verifique quantidade, ordem e orientação das páginas. Com linhas cortadas, sombras fortes ou caracteres desfocados, uma digitalização melhor ajuda frequentemente mais do que repetir OCR. Este guia destina-se a digitalizações, não à preservação de formulários interativos ou assinaturas digitais.

Configurar OCR e guardar PDF

  1. Abra o botão OCR no NAPS2; no Mac, a documentação indica Tools, OCR.
  2. Na primeira utilização, descarregue o idioma de reconhecimento necessário. Escolha o idioma do documento, não automaticamente o da interface.
  3. Ative a opção de tornar PDFs pesquisáveis com OCR. Para documentos multilingues, descarregue os pacotes e selecione vários idiomas.
  4. Guarde um novo PDF com nome distinto. Não substitua o original; aguarde o fim do reconhecimento e da gravação.

Normalmente o NAPS2 executa OCR ao guardar. O modo Best pode melhorar os resultados face a Fast, mas demora mais. As opções de balanço de brancos e ruído podem ajudar digitalizações fracas; verifique sempre o resultado.

Reler o resultado guardado

Feche o PDF guardado e abra exatamente esse ficheiro num leitor PDF. Pesquise uma palavra distintiva numa página inicial e noutra final. Selecione um parágrafo, copie para um editor de texto local e compare com a imagem.

Confira especialmente nomes, acentos, datas, separadores decimais e confusões como O/0 ou I/1. Verifique a ordem em colunas e tabelas. Montantes ou identificadores importantes exigem verificação completa; amostras não confirmam todas as páginas. Um resultado de pesquisa comprova apenas essa ocorrência.

Texto existente e limites

Segundo a documentação, ao importar PDFs o NAPS2 deixa intactas páginas que já contêm texto e usa OCR nas restantes. Reimportar não corrige automaticamente uma camada de texto errada já existente. Determine quais páginas são realmente só imagem, em vez de repetir o processamento.

OCR não traduz nem torna automaticamente o PDF acessível ou cria um ficheiro de texto corretamente formatado. O NAPS2 não exporta diretamente o resultado OCR como texto; o percurso documentado é guardar PDF e copiar no leitor. Conserve o original e documente erros por resolver antes de partilhar.

Fonte

NAPS2: OCR documentation