Um PDF em duas colunas sai com as colunas entrelaçadas
Você seleciona o texto de um artigo composto em duas colunas, copia, cola no Word — e uma linha da coluna da esquerda vem seguida de uma da direita, repetidamente. Dois textos distintos ficam trançados e já não dá para ver onde uma frase termina.
A causa é que um PDF não guarda nenhuma estrutura de coluna. O que está no arquivo são instruções: «desenhe este glifo nestas coordenadas». Nada ali diz onde começa uma coluna nem onde termina a outra. Copiar e extrair texto percorre a página de cima para baixo, linha a linha, pela posição do desenho, então duas colunas na mesma altura são recolhidas alternadamente, uma linha de cada vez.
Por isso as colunas precisam ser relidas a partir do leiaute. O PDFIntact localiza os blocos da página — texto, títulos, tabelas, figuras — e os recoloca na ordem de leitura antes de escrever para Word, Markdown e JSON. A composição em colunas não é reproduzida: o que sai é um documento de coluna única, na ordem de leitura.
Testar agora
Confira no seu próprio PDF
A verificação roda inteiramente no seu navegador. Seu arquivo nunca é enviado e não é preciso criar conta. Veja quantas páginas, tabelas e figuras dá para extrair antes de pagar.
Exemplo
行の拾われ方が変わります
左右に並んだ3行ずつの段が、どの順で並ぶかを示した図です。実際の文面ではなく、拾われる順序だけを表しています。
コピーしたとき(描かれた位置の順)
左の段 1行目 右の段 1行目 左の段 2行目 右の段 2行目 左の段 3行目 右の段 3行目
PDFIntact を通したとき(読み順)
左の段 1行目 左の段 2行目 左の段 3行目 右の段 1行目 右の段 2行目 右の段 3行目
形式ごとに、どう入るか
同じ読み順でも、書き出す形式によって入り方が違います。
Word(.docx)
読み順のまま、1段の段落として並びます。段組は再現しません。
Markdown(.md)
同じ範囲を、ページごとの見出しの下に読み順で置きます。
JSON
ブロックの種別・ページ番号・ページ内の座標つきで入るので、どの段のどこから来た文章かを後から辿れます。
Excel(.xlsx)
本文は入りません。Excelに書き出すのは表とグラフだけです。
脚注・キャプション・ページ番号
これらは本文とは別のブロックとして、読み順のその位置に段落で入ります。 2段組の論文では図のキャプションが本文と分けて取れること、 書籍のスキャンでは脚注の区切り線より下が別ブロックになりページ番号が本文に混ざらないことを、 それぞれ確認しています。Wordの脚注機能には入れません。段落として入ります。
Perguntas frequentes
- Por que as colunas se entrelaçam ao copiar um PDF em duas colunas?
- Porque um PDF não guarda uma coluna como coluna. O arquivo só diz «desenhe este glifo nestas coordenadas», e nada marca onde uma coluna começa nem onde a outra termina. Copiar percorre a página de cima para baixo, linha a linha, então duas colunas na mesma altura são recolhidas alternadamente, uma linha de cada vez.
- Como a ordem de leitura é recuperada?
- Primeiro se localizam os blocos da página — texto, títulos, tabelas, figuras — e depois eles voltam à ordem de leitura, antes de qualquer escrita. A composição em duas colunas não é reproduzida: Word e Markdown recebem um documento de coluna única, na ordem de leitura.
- O que acontece com notas de rodapé e legendas?
- Saem como blocos próprios, em forma de parágrafo, no lugar que ocupam na ordem de leitura. Nos nossos testes as legendas ficaram separadas do texto, tudo abaixo do fio de nota formou um bloco à parte e os números de página não se misturaram ao texto. Elas não viram notas de rodapé do Word: chegam como parágrafos.
- Para quais formatos o texto pode ser exportado?
- Word, Markdown e JSON. O JSON traz ainda o tipo de bloco, o número da página e a posição na página, então dá para rastrear de que coluna e de que ponto veio um trecho. O texto corrido não entra no Excel: uma exportação para Excel contém apenas tabelas e gráficos.
- Se a ordem de leitura está certa, os caracteres também estão?
- São coisas diferentes. A ordem de leitura pode se manter enquanto a leitura dos caracteres se desfaz, e foi o que vimos em uma amostra. Por isso cada bloco traz uma faixa de confiança — lido, estimado ou ilegível. Confira o resultado com o PDF original.
Verificar qualquer PDF em todos os sintomas/ O que vai em cada formato