PDFIntact

Extraia tabelas e texto do seu PDF, intactos

Descobrir se um PDF precisa de OCR, recuperação da camada de texto ou reconstrução do layout antes de extrair seu conteúdo

OCR ou extração de texto em PDF? Faça 3 testes antes de converter

Use testes de seleção, cópia e layout para descobrir se o PDF precisa de OCR, reparo da camada de texto ou reconstrução de tabelas e ordem de leitura.

Equipe editorial da PDFIntactPublicado em

Problemas de extração de PDF nem sempre exigem OCR

Quando o texto não sai corretamente de um PDF, aplicar OCR de imediato nem sempre é a solução certa. A maioria dos arquivos problemáticos se enquadra em um destes três estados:

  1. A página é apenas uma imagem e não contém dados de texto.
  2. Há dados de texto, mas o mapeamento entre os glifos exibidos e os caracteres copiados está ausente ou corrompido.
  3. Os caracteres podem ser extraídos, mas a estrutura da tabela ou a ordem de leitura em várias colunas se perde.

No primeiro caso, o OCR precisa reconhecer os caracteres da imagem. No segundo, pode ser necessário reconstruir o texto usando tanto sua aparência quanto as informações já presentes no arquivo. O terceiro é sobretudo um problema de reconstrução de layout, não de reconhecimento.

Faça os três testes a seguir antes de escolher o método de conversão.

Teste 1: é possível selecionar o texto?

Abra o arquivo em um leitor de PDF e arraste o cursor sobre uma frase.

Nada pode ser selecionado

A página inteira pode ser uma única imagem. Isso é comum em documentos digitalizados e arquivos exportados como imagem, e é um caso adequado para OCR.

A seleção também pode estar bloqueada pelas permissões do documento ou pelo próprio leitor. Teste o arquivo em outro leitor de PDF confiável antes de concluir que não existe camada de texto.

Uma área com o formato do texto pode ser selecionada

O PDF tem algum tipo de camada de texto. Antes de acrescentar OCR, copie uma amostra curta e examine o resultado. Uma segunda camada de OCR pode duplicar caracteres e dificultar buscas e cópias posteriores.

Teste 2: o que acontece ao copiar uma frase?

Cole um trecho curto em um editor de texto simples e classifique o resultado:

Resultado Estado possível Próxima ação provável
A frase é colada corretamente A camada de texto é utilizável Verifique apenas tabelas, colunas e outras estruturas
Surgem caracteres diferentes Os glifos exibidos não correspondem aos caracteres copiados Reconstrua o texto a partir da aparência visual
O resultado fica em branco A camada está incompleta ou a página é uma imagem Inspecione outras páginas
As palavras aparecem fora de ordem Há um problema de colunas ou ordem dos objetos Reconstrua a ordem de leitura
Cada caractere aparece duas vezes A imagem e uma camada de OCR podem estar sobrepostas Elimine as duplicações antes da extração

Não avalie o PDF inteiro por uma única página. Repita o teste em uma página comum de texto, em outra com tabela e em uma próxima do fim. Um mesmo documento pode misturar páginas digitalizadas e páginas geradas digitalmente.

Teste 3: os caracteres estão corretos, mas a estrutura se perdeu?

Copiar corretamente o texto corrido não garante uma extração utilizável. Uma tabela pode cair em uma coluna só, os lados esquerdo e direito de um artigo podem se alternar, ou as relações espaciais de uma equação podem desaparecer. Nesses casos, o reconhecimento dos caracteres funcionou; o que falta é a estrutura.

Para tabelas

Reconstrua limites das células, cabeçalhos mesclados e relações entre linhas e colunas. Aplicar mais OCR não recria a estrutura de células de uma tabela.

Para páginas em duas colunas

Determine a sequência pretendida — em geral, descer pela coluna esquerda e depois pela direita — em vez de ordenar todos os caracteres apenas pelas coordenadas da página.

Para equações

Sobrescritos, subscritos, frações e radicais precisam ser representados como estrutura matemática, não como uma sequência linear de caracteres.

Quando usar OCR e quando extrair o texto existente

Estado do PDF OCR Camada de texto existente Reconstrução estrutural
Apenas imagem digitalizada Necessário Indisponível Necessária se houver tabelas ou colunas
Texto copiado fica ilegível Pode ajudar na recuperação visual Pode fornecer pistas de posição Depende do layout
Texto corrido é copiado corretamente Em geral, desnecessário Aproveite-a Necessária para tabelas, colunas ou equações
Texto de OCR aparece duplicado Não acrescente outra camada Remova ou concilie as duplicações Conforme necessário

Um arquivo marcado como “pesquisável” ou “processado por OCR” não garante que a camada de texto seja utilizável. Ainda é preciso testar a seleção, a fidelidade da cópia, a ordem de leitura e a estrutura das tabelas.

Preserve o original antes de aplicar OCR novamente

Não substitua o PDF de origem por outro com uma nova camada de texto. Guarde o original, o PDF processado e o conteúdo extraído como arquivos separados para poder comparar o antes e o depois.

Inclua uma data ou versão no nome de cada arquivo e preserve a ligação entre cada saída e sua origem. Isso é especialmente importante quando os valores extraídos serão usados em análises.

Como decidir rapidamente

  1. É possível selecionar o texto?
  2. Uma frase pode ser copiada corretamente?
  3. Tabelas, colunas e equações mantêm sua estrutura?
  4. As páginas apresentam estados diferentes?
  5. A saída precisa ser Excel, Word, Markdown ou JSON?

Esses testes separam o reconhecimento de imagens da recuperação da camada de texto e da reconstrução de layout, evitando OCR desnecessário.

A verificação gratuita da PDFIntact é executada no navegador sem enviar o arquivo original. Ela informa a quantidade de páginas, o estado da camada de texto e as tabelas e figuras detectadas. Use esses dados para escolher o próximo passo e confira o resultado convertido com o PDF de origem.

Verifique sem enviar o arquivo

Conheça a estrutura deste PDF antes de converter

A verificação gratuita é feita no navegador. O arquivo original não é enviado.

Verifique grátis um PDF que não permite copiar