Convertir les tableaux d'un PDF en Markdown
Les tableaux sont ce qu'il y a de plus difficile à récupérer intact d'un PDF, parce qu'un PDF ignore qu'il en contient un. Dans les données, il n'y a ni lignes, ni cellules, ni bordures : seulement du texte placé à des coordonnées qui, par chance, s'alignent. Récupérer un tableau, c'est détecter cet alignement.
Comment extraire un tableau d'un PDF vers du Markdown ?
Déposez le PDF sur le convertisseur de cette page. Le texte qui s'aligne en colonnes régulières sur des lignes consécutives est détecté comme tableau et rendu en tableau Markdown au format GFM.
Pourquoi copier un tableau depuis un PDF donne-t-il un résultat illisible ?
La copie restitue le texte dans l'ordre où il a été dessiné, pas dans l'ordre de lecture, et un PDF ne contient aucune limite de cellule. La structure doit être reconstruite depuis les coordonnées, ce que le copier-coller ne tente pas.
Déposez votre PDF ici
ou choisissez un fichier sur votre ordinateur
PDF uniquement · jusqu'à 50 Mo
Comment convertir un tableau PDF en Markdown
- 1
Convertissez le document
Déposez le PDF sur le convertisseur. Les tableaux sont détectés automatiquement, en même temps que le reste du document.
- 2
Vérifiez le nombre de colonnes
Comparez l'aperçu à l'original. Une colonne systématiquement vide signale en général qu'un en-tête s'étendait sur deux colonnes dans la source.
- 3
Corrigez les écarts
Modifiez le Markdown directement dans le panneau de gauche. Un tableau au format pipe est du texte brut : ajouter ou fusionner une cellule est une retouche minime.
- 4
Copiez vers la destination
Collez le tableau dans GitHub, Obsidian, un README ou un site de documentation. Le format GFM s'affiche correctement partout.
Comment fonctionne la détection des tableaux
Chaque fragment de texte d'un PDF porte une coordonnée horizontale et une largeur. Le convertisseur découpe chaque ligne là où l'écart entre deux fragments dépasse environ une fois et demie la hauteur de la police du corps de texte : bien plus qu'une espace entre deux mots, bien moins qu'une gouttière entre colonnes.
Cela seul se tromperait sur les paragraphes justifiés, qui comportent aussi de larges écarts. Le détecteur ajoute donc une seconde condition : les écarts doivent tomber au même endroit sur des lignes consécutives. Un espacement irrégulier entre les mots ne s'aligne jamais d'une ligne à l'autre ; une vraie colonne, si.
Un bloc n'est converti en tableau que lorsque au moins deux lignes consécutives partagent au moins deux positions de colonne récurrentes. Tout le reste demeure du texte de paragraphe.
Ce qui survit et ce qui se perd
La syntaxe des tableaux Markdown est volontairement minimale, ce qui plafonne d'emblée ce que n'importe quel convertisseur peut préserver.
- Conservé : la structure des colonnes, l'ordre des lignes, le texte des cellules, ainsi que le gras et l'italique à l'intérieur d'une cellule
- Conservé : la première ligne est traitée comme l'en-tête, conformément à la mise en page de la quasi-totalité des documents
- Perdu : les cellules fusionnées, sans équivalent en Markdown, qui s'aplatissent dans la colonne de gauche
- Perdu : les tableaux imbriqués, les couleurs de fond, les bordures et les largeurs de colonne
- Approché : une cellule dont le texte s'étale sur plusieurs lignes est regroupée en une seule cellule
Quand la détection peine
Le cas difficile, ce sont les tableaux sans alignement régulier : cellules centrées une à une, ou colonne de nombres alignée à droite jouxtant une voisine alignée à gauche avec un écart étroit. Le détecteur est réglé pour préférer laisser le texte en paragraphes plutôt qu'inventer un tableau qui n'a jamais existé, car un tableau erroné est plus pénible à nettoyer que du texte brut.
États financiers, listes de prix, fiches techniques et tableaux comparatifs se convertissent généralement bien. Les formulaires denses à champs encadrés, non : leur structure vient de rectangles dessinés, pas de l'alignement du texte.
Questions fréquentes
- Puis-je extraire uniquement les tableaux et ignorer le reste ?
- Pas automatiquement. Le document entier est converti, tableaux à leur place. Comme le résultat est du texte brut, supprimer les paragraphes alentour prend quelques secondes.
- Et les tableaux qui s'étendent sur plusieurs pages ?
- Chaque page est détectée séparément : un tableau qui franchit un saut de page produit donc deux tableaux. Les fusionner revient à supprimer la ligne d'en-tête répétée.
- Gère-t-il les colonnes de nombres alignées à droite ?
- En général oui. La détection regroupe les cellules par leur bord gauche : une colonne alignée à droite composée de nombres de largeurs variables peut donc parfois se scinder. Vérifiez les totaux avec la source.
- Puis-je obtenir du CSV plutôt que du Markdown ?
- Pas pour l'instant. Un tableau Markdown se convertit facilement en CSV dans un tableur ou avec un court script, et l'export CSV figure à la feuille de route.
Convertisseurs associés
- PDF en MarkdownTitres, listes et tableaux reconstruits depuis la mise en page, dans votre navigateur et sans aucun envoi.
- PDF vers ObsidianTransformez un PDF en note de coffre avec de vrais titres : plan, graphe et liens fonctionnent.
- PDF vers NotionFaites entrer le contenu du PDF dans Notion en blocs modifiables, pas en simple pièce jointe.