PDFIntact

Extraia tabelas e texto do seu PDF, intactos

Não dá para selecionar nem copiar o texto de um PDF digitalizado

Você tenta selecionar o texto de um documento vindo do scanner do escritório e nada acontece. A busca não encontra nada. Arrastar seleciona um retângulo em vez de palavras.

A razão é que o arquivo é apenas uma imagem de papel. O scanner salva a aparência da página. Para os seus olhos é texto; dentro do arquivo não é diferente de uma fotografia. Não há dado de caractere algum, então não há o que selecionar, copiar ou pesquisar.

Para extraí-lo é preciso ler os caracteres a partir da imagem. Impressão fraca, inclinação e baixa resolução produzem trechos que não podem ser lidos. O PDFIntact marca esses trechos como ilegíveis em vez de deixá-los em branco — preencher em silêncio é justamente o que torna o erro impossível de perceber.

Testar agora

Confira no seu próprio PDF

A verificação roda inteiramente no seu navegador. Seu arquivo nunca é enviado e não é preciso criar conta. Veja quantas páginas, tabelas e figuras dá para extrair antes de pagar.

Exemplo

まず見分けてください

同じ「PDF」でも、原因によって対処が変わります。次のどれに当てはまるかで判断できます。

文字を選択できない・検索しても出てこない
スキャンPDF(画像)です。このページの対象です。
選択もコピーもできるが、貼り付けると読めない文字になる
画像ではなく、フォントの対応表が欠けている状態です。PDFをコピーすると文字化けする をご覧ください。
文字は取り出せるが、表の行と列がずれる
PDFが表の構造を持っていないためです。PDFの表をExcelに貼り付けるとずれる をご覧ください。

Perguntas frequentes

Por que não consigo copiar o texto de um PDF digitalizado?
Porque o PDF contém uma fotografia da página, não dados de caractere. Para você parece texto, mas para o arquivo é uma imagem: não há nada para selecionar nem pesquisar.
Como faço para poder selecionar?
Os caracteres precisam ser reconhecidos a partir da imagem. O PDFIntact analisa cada página e exporta texto, tabelas e gráficos para Excel, Word, Markdown ou JSON. Antes de pagar, você verifica no navegador se o seu arquivo pode ser lido.
Vocês leem manuscrito?
Documentos formados só por escrita à mão ficam fora do escopo. Use com documentos majoritariamente impressos. A verificação diz antes da compra o que não pode ser convertido.
Dá para extrair tabelas de documentos digitalizados?
Sim, com filetes e células mescladas reproduzidos. Impressão fraca, inclinação ou baixa resolução deixam trechos sem leitura; eles são informados como ilegíveis em vez de adivinhados.
O que acontece com o arquivo que envio?
A verificação roda inteiramente no seu navegador e o original nunca é enviado. Um PDF mandado para conversão é apagado em 24 horas e, por projeto, nada chega aos nossos servidores antes de o pagamento ser concluído.

Verificar qualquer PDF em todos os sintomasO que vai em cada formato