Convertir tablas de PDF a Markdown
Las tablas son lo más difícil de rescatar de un PDF, porque el PDF no sabe que contiene una. En los datos no hay filas, ni celdas, ni bordes: solo texto colocado en coordenadas que casualmente se alinean. Recuperar una tabla consiste en detectar esa alineación.
¿Cómo extraigo una tabla de un PDF a Markdown?
Suelta el PDF en el conversor de esta página. El texto que se alinea en columnas constantes a lo largo de filas consecutivas se detecta como tabla y se convierte en una tabla Markdown con formato GFM.
¿Por qué al copiar una tabla de un PDF sale todo desordenado?
Al copiar se obtiene el texto en el orden en que se dibujó, no en orden de lectura, y un PDF no contiene límites de celda. La estructura hay que reconstruirla desde las coordenadas, algo que copiar y pegar ni intenta.
Suelta tu PDF aquí
o elige un archivo de tu ordenador
Solo PDF · hasta 50 MB
Cómo convertir una tabla de un PDF a Markdown
- 1
Convierte el documento
Suelta el PDF en el conversor. Las tablas se detectan automáticamente junto con el resto del documento.
- 2
Comprueba el número de columnas
Compara la vista previa con el original. Una columna sistemáticamente vacía suele indicar que un encabezado abarcaba dos columnas en el documento de origen.
- 3
Corrige lo que se haya desviado
Edita el Markdown directamente en el panel izquierdo. Las tablas son texto plano, así que añadir o unir una celda es un cambio mínimo.
- 4
Llévala a su destino
Pega la tabla en GitHub, en Obsidian, en un README o en un sitio de documentación. El formato GFM se muestra bien en todos ellos.
Cómo funciona la detección de tablas
Cada fragmento de texto de un PDF lleva una coordenada horizontal y un ancho. El conversor divide cada línea allí donde el hueco entre dos fragmentos supera aproximadamente vez y media la altura de la fuente del cuerpo: mucho más que un espacio entre palabras y menos que la separación entre columnas.
Eso por sí solo fallaría con los párrafos justificados, que también tienen huecos anchos. Por eso el detector añade una segunda condición: los huecos tienen que caer en el mismo sitio en líneas consecutivas. El espaciado irregular entre palabras nunca se alinea de una fila a otra; una columna real sí lo hace siempre.
Un bloque solo se convierte en tabla cuando al menos dos filas consecutivas comparten al menos dos posiciones de columna recurrentes. Todo lo demás se queda como texto de párrafo.
Qué se conserva y qué no
La sintaxis de tablas de Markdown es deliberadamente mínima, lo que impone un techo a lo que cualquier conversor puede preservar.
- Se conserva: la estructura de columnas, el orden de las filas, el texto de las celdas y la negrita o cursiva dentro de una celda
- Se conserva: la primera fila se toma como encabezado, tal como la disponen casi todos los documentos
- Se pierde: las celdas combinadas, que no tienen equivalente en Markdown y se aplanan en la columna de la izquierda
- Se pierde: las tablas anidadas, los colores de fondo, los bordes y el ancho de las columnas
- Se aproxima: una celda cuyo texto ocupa varias líneas se une en una sola celda
Cuándo le cuesta a la detección
El caso difícil son las tablas sin alineación constante: cuando cada celda se centra por separado, o cuando una columna de números alineada a la derecha queda pegada a otra alineada a la izquierda. El detector está ajustado para preferir dejar el texto como párrafos antes que inventar una tabla que nunca existió, porque una tabla equivocada cuesta más de arreglar que el texto plano.
Los estados financieros, las listas de precios, las hojas de especificaciones y las tablas comparativas suelen convertirse bien. Los formularios densos con campos encuadrados no, porque su estructura viene de rectángulos dibujados y no de la alineación del texto.
Preguntas frecuentes
- ¿Puedo extraer solo las tablas y omitir el resto?
- No de forma automática. Se convierte el documento entero, con las tablas en su sitio. Como el resultado es texto plano, borrar los párrafos que sobran lleva unos segundos.
- ¿Y las tablas que ocupan varias páginas?
- Cada página se detecta por separado, así que una tabla que cruza un salto de página produce dos tablas. Unirlas es cuestión de borrar la fila de encabezado repetida.
- ¿Gestiona bien las columnas de números alineadas a la derecha?
- Casi siempre. La detección agrupa las celdas por su borde izquierdo, así que una columna alineada a la derecha con números de distinto ancho puede partirse. Comprueba los totales con el original.
- ¿Puedo obtener CSV en vez de Markdown?
- Por ahora no. Una tabla Markdown se pasa a CSV fácilmente con una hoja de cálculo o un script corto, y la exportación a CSV está en la hoja de ruta.
Conversores relacionados
- PDF a MarkdownTítulos, listas y tablas reconstruidos desde el diseño de la página, en tu navegador y sin subir el archivo.
- PDF a ObsidianConvierte un PDF en una nota de tu bóveda con títulos reales: esquema, grafo y enlaces funcionan.
- PDF a NotionLleva el contenido del PDF a Notion como bloques editables, no como un adjunto que solo puedes ver.