PDFIntact

Extrae las tablas y el texto de tu PDF, tal cual

Un PDF a dos columnas sale con las columnas entremezcladas

Seleccionas el texto de un artículo compuesto a dos columnas, lo copias, lo pegas en Word — y a una línea de la columna izquierda le sigue una de la derecha, una y otra vez. Dos discursos distintos quedan trenzados y ya no se distingue dónde termina una frase.

La causa es que un PDF no guarda ninguna estructura de columna. Su contenido son instrucciones: «dibuja este glifo en estas coordenadas». Nada en el archivo dice dónde empieza una columna ni dónde acaba la otra. Copiar y extraer texto recorre la página de arriba abajo, línea a línea, según la posición de trazado, así que dos columnas a la misma altura se recogen alternándose, una línea cada vez.

Por eso hay que releer las columnas desde la maquetación. PDFIntact localiza los bloques de la página —texto, títulos, tablas, figuras— y los devuelve al orden de lectura antes de escribir a Word, Markdown y JSON. La composición a columnas no se reproduce: obtienes un documento a una sola columna, en orden de lectura.

Pruébalo ahora

Compruébalo con tu propio PDF

El análisis se realiza solo en tu navegador. Tu archivo nunca se sube y no hace falta cuenta. Comprueba antes de pagar cuántas páginas y cuántas tablas y figuras se pueden extraer.

Ejemplo

行の拾われ方が変わります

左右に並んだ3行ずつの段が、どの順で並ぶかを示した図です。実際の文面ではなく、拾われる順序だけを表しています。

コピーしたとき(描かれた位置の順)

左の段 1行目
右の段 1行目
左の段 2行目
右の段 2行目
左の段 3行目
右の段 3行目

PDFIntact を通したとき(読み順)

左の段 1行目
左の段 2行目
左の段 3行目
右の段 1行目
右の段 2行目
右の段 3行目

形式ごとに、どう入るか

同じ読み順でも、書き出す形式によって入り方が違います。

Word(.docx)

読み順のまま、1段の段落として並びます。段組は再現しません。

Markdown(.md)

同じ範囲を、ページごとの見出しの下に読み順で置きます。

JSON

ブロックの種別・ページ番号・ページ内の座標つきで入るので、どの段のどこから来た文章かを後から辿れます。

Excel(.xlsx)

本文は入りません。Excelに書き出すのは表とグラフだけです。

脚注・キャプション・ページ番号

これらは本文とは別のブロックとして、読み順のその位置に段落で入ります。 2段組の論文では図のキャプションが本文と分けて取れること、 書籍のスキャンでは脚注の区切り線より下が別ブロックになりページ番号が本文に混ざらないことを、 それぞれ確認しています。Wordの脚注機能には入れません。段落として入ります。

Preguntas frecuentes

¿Por qué se entremezclan las columnas al copiar un PDF a dos columnas?
Porque un PDF no guarda una columna como columna. El archivo solo dice «dibuja este glifo en estas coordenadas», y nada marca dónde empieza una columna ni dónde acaba la otra. Al copiar se recorre la página de arriba abajo, línea a línea, así que dos columnas a la misma altura se recogen alternándose, una línea cada vez.
¿Cómo se recupera el orden de lectura?
Primero se localizan los bloques de la página —texto, títulos, tablas, figuras— y luego se devuelven al orden de lectura antes de escribir nada. La composición a dos columnas no se reproduce: Word y Markdown reciben un documento a una sola columna, en orden de lectura.
¿Qué pasa con las notas al pie y los pies de figura?
Salen como bloques propios, en forma de párrafo, en su lugar dentro del orden de lectura. En nuestras pruebas los pies de figura se mantuvieron separados del texto, todo lo que quedaba bajo la línea de nota formó un bloque aparte y los números de página no se mezclaron con el texto. No se convierten en notas al pie de Word: llegan como párrafos.
¿A qué formatos se puede exportar el texto?
Word, Markdown y JSON. El JSON lleva además el tipo de bloque, el número de página y la posición en la página, así que puedes rastrear de qué columna y de qué punto procede un pasaje. El texto corrido no va a Excel: una exportación a Excel contiene solo tablas y gráficos.
Si el orden de lectura es correcto, ¿lo son también los caracteres?
Son dos cosas distintas. El orden de lectura puede mantenerse mientras la lectura de los caracteres se rompe, y así ocurrió en una muestra. Por eso cada bloque lleva una banda de fiabilidad: leído, estimado o ilegible. Contrasta el resultado con el PDF original.

Analizar un PDF con todos los síntomasQué incluye cada formato