Descobrir se um PDF precisa de OCR, recuperação da camada de texto ou reconstrução do layout antes de extrair seu conteúdo
OCR ou extração de texto em PDF? Faça 3 testes antes de converter
Use testes de seleção, cópia e layout para descobrir se o PDF precisa de OCR, reparo da camada de texto ou reconstrução de tabelas e ordem de leitura.
Problemas de extração de PDF nem sempre exigem OCR
Quando o texto não sai corretamente de um PDF, aplicar OCR de imediato nem sempre é a solução certa. A maioria dos arquivos problemáticos se enquadra em um destes três estados:
- A página é apenas uma imagem e não contém dados de texto.
- Há dados de texto, mas o mapeamento entre os glifos exibidos e os caracteres copiados está ausente ou corrompido.
- Os caracteres podem ser extraídos, mas a estrutura da tabela ou a ordem de leitura em várias colunas se perde.
No primeiro caso, o OCR precisa reconhecer os caracteres da imagem. No segundo, pode ser necessário reconstruir o texto usando tanto sua aparência quanto as informações já presentes no arquivo. O terceiro é sobretudo um problema de reconstrução de layout, não de reconhecimento.
Faça os três testes a seguir antes de escolher o método de conversão.
Teste 1: é possível selecionar o texto?
Abra o arquivo em um leitor de PDF e arraste o cursor sobre uma frase.
Nada pode ser selecionado
A página inteira pode ser uma única imagem. Isso é comum em documentos digitalizados e arquivos exportados como imagem, e é um caso adequado para OCR.
A seleção também pode estar bloqueada pelas permissões do documento ou pelo próprio leitor. Teste o arquivo em outro leitor de PDF confiável antes de concluir que não existe camada de texto.
Uma área com o formato do texto pode ser selecionada
O PDF tem algum tipo de camada de texto. Antes de acrescentar OCR, copie uma amostra curta e examine o resultado. Uma segunda camada de OCR pode duplicar caracteres e dificultar buscas e cópias posteriores.
Teste 2: o que acontece ao copiar uma frase?
Cole um trecho curto em um editor de texto simples e classifique o resultado:
| Resultado | Estado possível | Próxima ação provável |
|---|---|---|
| A frase é colada corretamente | A camada de texto é utilizável | Verifique apenas tabelas, colunas e outras estruturas |
| Surgem caracteres diferentes | Os glifos exibidos não correspondem aos caracteres copiados | Reconstrua o texto a partir da aparência visual |
| O resultado fica em branco | A camada está incompleta ou a página é uma imagem | Inspecione outras páginas |
| As palavras aparecem fora de ordem | Há um problema de colunas ou ordem dos objetos | Reconstrua a ordem de leitura |
| Cada caractere aparece duas vezes | A imagem e uma camada de OCR podem estar sobrepostas | Elimine as duplicações antes da extração |
Não avalie o PDF inteiro por uma única página. Repita o teste em uma página comum de texto, em outra com tabela e em uma próxima do fim. Um mesmo documento pode misturar páginas digitalizadas e páginas geradas digitalmente.
Teste 3: os caracteres estão corretos, mas a estrutura se perdeu?
Copiar corretamente o texto corrido não garante uma extração utilizável. Uma tabela pode cair em uma coluna só, os lados esquerdo e direito de um artigo podem se alternar, ou as relações espaciais de uma equação podem desaparecer. Nesses casos, o reconhecimento dos caracteres funcionou; o que falta é a estrutura.
Para tabelas
Reconstrua limites das células, cabeçalhos mesclados e relações entre linhas e colunas. Aplicar mais OCR não recria a estrutura de células de uma tabela.
Para páginas em duas colunas
Determine a sequência pretendida — em geral, descer pela coluna esquerda e depois pela direita — em vez de ordenar todos os caracteres apenas pelas coordenadas da página.
Para equações
Sobrescritos, subscritos, frações e radicais precisam ser representados como estrutura matemática, não como uma sequência linear de caracteres.
Quando usar OCR e quando extrair o texto existente
| Estado do PDF | OCR | Camada de texto existente | Reconstrução estrutural |
|---|---|---|---|
| Apenas imagem digitalizada | Necessário | Indisponível | Necessária se houver tabelas ou colunas |
| Texto copiado fica ilegível | Pode ajudar na recuperação visual | Pode fornecer pistas de posição | Depende do layout |
| Texto corrido é copiado corretamente | Em geral, desnecessário | Aproveite-a | Necessária para tabelas, colunas ou equações |
| Texto de OCR aparece duplicado | Não acrescente outra camada | Remova ou concilie as duplicações | Conforme necessário |
Um arquivo marcado como “pesquisável” ou “processado por OCR” não garante que a camada de texto seja utilizável. Ainda é preciso testar a seleção, a fidelidade da cópia, a ordem de leitura e a estrutura das tabelas.
Preserve o original antes de aplicar OCR novamente
Não substitua o PDF de origem por outro com uma nova camada de texto. Guarde o original, o PDF processado e o conteúdo extraído como arquivos separados para poder comparar o antes e o depois.
Inclua uma data ou versão no nome de cada arquivo e preserve a ligação entre cada saída e sua origem. Isso é especialmente importante quando os valores extraídos serão usados em análises.
Como decidir rapidamente
- É possível selecionar o texto?
- Uma frase pode ser copiada corretamente?
- Tabelas, colunas e equações mantêm sua estrutura?
- As páginas apresentam estados diferentes?
- A saída precisa ser Excel, Word, Markdown ou JSON?
Esses testes separam o reconhecimento de imagens da recuperação da camada de texto e da reconstrução de layout, evitando OCR desnecessário.
A verificação gratuita da PDFIntact é executada no navegador sem enviar o arquivo original. Ela informa a quantidade de páginas, o estado da camada de texto e as tabelas e figuras detectadas. Use esses dados para escolher o próximo passo e confira o resultado convertido com o PDF de origem.
Verifique sem enviar o arquivo
Conheça a estrutura deste PDF antes de converter
A verificação gratuita é feita no navegador. O arquivo original não é enviado.
Verifique grátis um PDF que não permite copiar