Convertir un PDF en Markdown

Transformez n'importe quel PDF en Markdown propre et structuré : titres, tableaux, listes et liens sont conservés.

Tableaux et titres conservés
Conversion par lot
Sécurisé et confidentiel

Déposez les fichiers PDF ici

Relâchez pour ajouter les fichiers

Un analyseur de PDF, pas un vidage de texte

La plupart des outils « PDF vers texte » renvoient un mur de lignes dans l'ordre où le fichier les a stockées par hasard. Celui-ci reconstruit le document : quelles lignes étaient un titre, quel bloc était un tableau, quelle colonne vient en premier et où un saut de page a coupé un paragraphe en deux.

Extraction de texte brut

Résultats trimestriels
Le chiffre d'affaires a progressé
de 18 % sur un an. Le tableau
Région T3 T4
EMEA 4,1 4,8
APAC 2,7 3,9
ci-dessous détaille la performance
par région.

Ce convertisseur

## Résultats trimestriels

Le chiffre d'affaires a progressé de
18 % sur un an. Le tableau ci-dessous
détaille la performance par région.

| Région | T3  | T4  |
|--------|-----|-----|
| EMEA   | 4,1 | 4,8 |
| APAC   | 2,7 | 3,9 |

Le même PDF. La différence, c'est la structure : un niveau de titre, un vrai tableau et un paragraphe reconstitué autour du bloc qui l'interrompait.

Ce qui survit à la conversion

La structure est déduite de la géométrie de la mise en page, pas devinée à partir de la ponctuation.

Titres et listes

Les niveaux de titre proviennent de la taille et de la graisse relatives de la police : un H2 reste donc un H2 au lieu de devenir un paragraphe de plus. Les listes numérotées et à puces conservent leur imbrication, et les passages en gras, en italique et en chasse fixe sont repris en emphase et code en ligne Markdown.

Tableaux, avec ou sans filets

Les tableaux encadrés sont détectés grâce à leurs filets. Ceux qui n'en ont pas — en réalité de simples colonnes de texte alignées — sont repérés en regroupant les positions des cellules, précisément là où la plupart des convertisseurs abandonnent et produisent un fouillis de fragments séparés par des tabulations.

Ordre de lecture multicolonne

Une page à deux colonnes stocke son texte dans un flux unique qui zigzague entre les colonnes. Lue naïvement, une ligne sur deux provient du mauvais endroit. Les limites de colonne sont détectées d'abord, si bien que chaque colonne est lue de haut en bas avant que la suivante ne commence.

Liens et réparation des sauts de page

Les annotations de lien hypertexte deviennent de vrais liens Markdown au lieu d'être aplaties en texte nu. Les paragraphes coupés par une limite de page — avec un en-tête, un pied de page et un numéro de page coincés au milieu — sont recousus en un seul paragraphe.

Conversion par lot

Envoyez tout un dossier de PDF en une seule tâche et récupérez un ZIP contenant chaque fichier .md ainsi qu'un manifeste CONVERSION_REPORT.md consignant le sort de chacun. Disponible sur les offres avec la conversion par lot activée.

Confidentiel par défaut

Les fichiers sont envoyés en TLS, traités, puis supprimés automatiquement à l'expiration de la durée de conservation de votre offre. Les aperçus de page sont générés localement dans votre navigateur : un PDF que vous renoncez à convertir ne quitte donc jamais votre machine.

Les quatre choses qui font échouer les convertisseurs de PDF

Un PDF stocke des glyphes à des coordonnées. Il ne stocke ni paragraphes, ni tableaux, ni ordre de lecture : tout cela doit être déduit. Voici ce que cette déduction doit affronter.

Mises en page à deux colonnes

Le problème

Les articles universitaires, les lettres d'information et les rapports annuels disposent le texte en colonnes, mais le flux de contenu sous-jacent traverse souvent la page de part en part. Extrait dans l'ordre stocké, il donne la ligne un de la colonne A, puis la ligne un de la colonne B, puis la ligne deux de la colonne A : un enchevêtrement illisible. L'analyseur détecte d'abord la gouttière verticale et lit chaque colonne comme un bloc distinct.

Tableaux sans filets

Le problème

Quantité de tableaux ne comportent aucun trait ; un lecteur humain les perçoit comme un tableau uniquement parce que les valeurs sont alignées. Sans filets à détecter, le seul indice reste l'analyse géométrique des points où le texte commence et s'arrête sur chaque ligne. Lignes et colonnes sont déduites de ces alignements et reconstruites en tableaux Markdown.

Paragraphes coupés par un saut de page

Le problème

Une phrase qui commence en bas de la page 4 et se termine en haut de la page 5 a un en-tête courant, un pied de page et un numéro de page entre ses deux moitiés. Ces éléments répétés sont repérés d'une page à l'autre puis supprimés, et les deux fragments sont réunis en un seul paragraphe.

Pages sans aucun texte

Le problème

Une page numérisée contient une image, pas des caractères : il n'y a littéralement rien à extraire. Plutôt que de produire une section vide en silence, ces pages sont comptées et signalées par leur numéro, si bien qu'un résultat court est expliqué au lieu de ressembler à un bogue. Activez l'OCR et elles sont lues.

Pages numérisées : signalées par défaut, lisibles à la demande

Si une page n'a pas de couche de texte, le convertisseur vous indique les pages concernées au lieu de produire discrètement un fichier plus court. L'OCR facultatif lit ces pages comme du texte — désactivé par défaut, car il s'agit d'un vrai compromis et non d'une amélioration gratuite.

Ce qu'il récupère

Titres, listes, tableaux et ordre de lecture reviennent tous, parce qu'ils découlent de la position des mots sur la page et non de métadonnées de police.

Ce qu'il coûte

Environ 1,5 seconde par page contre à peu près 50 millisecondes sans lui — près de trente fois plus lent — et il est plafonné à 50 pages par document.

Ce qu'il ne peut pas récupérer

Le gras et l'italique. La sortie de l'OCR ne comporte aucune information de police : l'emphase sur les pages reconnues est donc définitivement perdue. Les erreurs de reconnaissance sur les numérisations médiocres sont également normales.

L'OCR utilise le même droit d'accès que l'outil OCR autonome. Les pages lues de cette façon sont listées séparément dans le résultat, pour que vous sachiez exactement quelles parties du document vérifier.

Convertir de nombreux fichiers d'un coup

Le mode par lot part du principe que, dans n'importe quel vrai dossier de PDF, au moins un fichier posera problème.

1

Une tâche, un ZIP

Chaque PDF devient son propre fichier .md dans une seule archive : migrer une documentation tient en un envoi et un téléchargement plutôt qu'en une boucle répétitive.

2

Un mauvais fichier ne coule jamais le lot

Un PDF endommagé ou verrouillé échoue de son côté. Les autres sont convertis normalement et restent téléchargeables — vous ne repartez jamais de zéro à cause d'un seul fichier.

3

Un relevé de ce qui s'est passé

Le fichier CONVERSION_REPORT.md, dans le ZIP, consigne le résultat de chaque fichier source : pages converties, pages qui étaient des numérisations, pages impossibles à analyser.

4

Un mot de passe par fichier

Les PDF protégés partagent rarement un mot de passe. Chaque fichier verrouillé dispose de son propre champ, vérifié dans votre navigateur avant l'envoi : une faute de frappe est repérée immédiatement et non après un long transfert.

Markdown, texte brut ou Word ?

Les trois extraient des mots d'un PDF. Ils diffèrent par la part de la forme du document qui les accompagne, et par ce que vous pouvez en faire ensuite.

MarkdownTexte brut (.txt)Word (.docx)
TitresConservés en niveaux #PerdusConservés en styles
TableauxTableaux MarkdownPerdusConservés
Se lit bien dans un diffOuiOuiNon — format binaire
S'affiche sur GitHub, wikis, sites de docNativementEn bloc de codePas sans conversion
Bonne entrée pour un LLM ou un index de rechercheIdéal — la structure subsisteUtilisable, structure perdueExtraction préalable requise
Modifiable dans n'importe quel éditeur de texteOuiOuiNon

Règle générale : Markdown quand le texte sera lu, versionné ou retraité ; Word quand il sera remis en page et imprimé.

Comment convertir un PDF en Markdown

Aucun compte nécessaire pour l'essayer, aucun logiciel à installer.

1

Ajoutez vos PDF

Faites glisser des fichiers n'importe où sur la page ou utilisez le sélecteur. Chacun reçoit une miniature de sa première page et un nombre de pages, générés localement dans votre navigateur.

2

Réglez les options

Extrayez au besoin les images intégrées, activez l'OCR pour les pages numérisées et saisissez un mot de passe pour tout fichier affiché comme verrouillé.

3

Convertissez

Un fichier est converti immédiatement. Plusieurs sont mis en file d'attente comme un lot et traités ensemble, avec une progression affichée à mesure que chacun se termine.

4

Téléchargez et lisez les remarques

Vous obtenez un fichier .md, ou un ZIP si des images ont été extraites ou si plusieurs fichiers ont été convertis. Lisez l'avis s'il apparaît : il indique quelles pages ont demandé de l'attention.

Où cela sert vraiment

Partout où un PDF doit devenir du texte exploitable par une machine ou par un gestionnaire de versions.

Migration de documentation

Manuels anciens, procédures et fiches techniques enfermés dans des PDF rejoignent un site de documentation, un wiki ou un dépôt avec leurs titres et tableaux intacts — sans ressaisie ni passe de remise en forme.

Chaînes RAG et contexte pour LLM

La qualité de la recherche dépend beaucoup du découpage, et le découpage dépend de la structure. Les titres Markdown donnent au découpeur de vraies frontières où couper, ce que le texte brut n'offre tout simplement pas.

Recherche et prise de notes

Importez des articles dans Obsidian, Notion ou Logseq avec sections et tableaux préservés, pour que citations et figures restent rattachées au titre dont elles proviennent.

Documents sous gestion de versions

Le Markdown se compare ligne à ligne dans git. Un contrat ou une politique converti une fois peut ensuite être suivi, relu et validé selon le même flux de travail que du code.

Contenu pour sites statiques et CMS

Le Markdown est le format d'entrée natif de Hugo, Jekyll, Astro, Docusaurus et de la plupart des CMS découplés : les fichiers convertis se déposent directement dans un répertoire de contenu.

Extraction de données depuis des rapports

Les états financiers et les rapports d'enquête enfouissent leurs chiffres dans des tableaux. Les tableaux Markdown s'analysent trivialement, ce qui rend ces valeurs accessibles à un script.

Ce qu'il ne fera pas

Autant le savoir d'emblée : un convertisseur qui masque ses limites inspire moins confiance qu'un convertisseur qui les nomme.

Les pages difficiles sont signalées, pas dissimulées

Les pages qui étaient des numérisations, celles qui n'ont pas pu être analysées et celles jugées trop complexes pour la détection de tableaux sont chacune indiquées par leur numéro dans le résultat. Les pages complexes produisent tout de même leur texte sous forme de paragraphes — c'est la forme du tableau qui est perdue.

Les limites de taille et de pages viennent de votre offre

Taille de fichier maximale, pages par document et fichiers par lot sont tous fixés par votre offre et affichés dans le panneau à côté de la zone d'envoi. La valeur montrée est toujours la vôtre, à l'instant.

Les fichiers chiffrés exigent leur mot de passe

Un PDF verrouillé ne peut pas être lu sans lui. Les mots de passe servent à cette seule conversion, sont vérifiés au préalable dans votre navigateur et ne sont jamais conservés.

Questions fréquentes

Fonctionne-t-il sur les PDF numérisés ?

Pas sans OCR, car une page numérisée contient une image plutôt que des caractères — il n'y a rien à extraire. Le convertisseur vous indique précisément quelles pages étaient des numérisations, et activer l'OCR permet de les lire. Attendez-vous à une exécution nettement plus lente et à la perte du gras et de l'italique sur ces pages.

Les tableaux sont-ils vraiment conservés, ou seulement approchés ?

Les tableaux à filets comme les mises en page en colonnes alignées sans bordures sont détectés et reconstruits en tableaux Markdown. Les pages très complexes — cellules fusionnées, tableaux imbriqués, mise en forme visuelle chargée — retombent sur de simples paragraphes, et ces pages sont listées dans le résultat pour que vous sachiez lesquelles vérifier.

Qu'advient-il des images contenues dans le PDF ?

Par défaut elles sont ignorées et vous obtenez un seul fichier .md. Cochez « extraire les images intégrées » et le résultat est un ZIP contenant votre Markdown et un dossier images/, le Markdown pointant vers chaque fichier extrait.

Puis-je convertir plusieurs PDF à la fois ?

Oui, avec une offre où la conversion par lot est activée. Les fichiers sont mis en file d'attente comme une seule tâche et renvoyés dans un ZIP accompagné d'un rapport de conversion. Sans cette option, vous pouvez toujours convertir autant de fichiers que vous voulez, un par un.

Comment gère-t-il les articles universitaires à deux colonnes ?

Les limites de colonne sont détectées avant toute lecture de texte, si bien que chaque colonne est traitée de haut en bas à tour de rôle. Sans cette étape, l'extraction alterne entre les colonnes ligne par ligne et le résultat est inutilisable — d'où les difficultés de tant d'outils avec les articles précisément.

Puis-je convertir un PDF protégé par mot de passe ?

Oui. Les fichiers verrouillés affichent un champ de mot de passe sur leur propre carte, et le mot de passe est vérifié dans votre navigateur avant tout envoi : une erreur est donc repérée instantanément. Dans un lot, chaque fichier peut avoir un mot de passe différent.

Quelle taille de fichier puis-je convertir ?

Cela dépend de votre offre. La limite affichée sous la zone d'envoi est la vôtre, lue en direct depuis votre compte plutôt que fixée en dur : passer à une offre supérieure la relève immédiatement.

Le Markdown est-il publiable tel quel ?

Le plus souvent, presque. Titres, listes, tableaux et liens ressortent proprement, et la sortie est du CommonMark standard qui s'affiche sur GitHub, dans les wikis et dans les générateurs de sites statiques. Les documents à mise en page inhabituelle méritent une relecture rapide, et l'avis du résultat vous indique où regarder.

Combien de temps mes fichiers sont-ils conservés ?

Les envois et les résultats sont supprimés automatiquement à l'issue de la durée de conservation de votre offre, indiquée sous la zone d'envoi. Vous pouvez aussi supprimer un fichier converti immédiatement depuis l'écran de téléchargement.

Ai-je besoin d'un compte ?

Non. La conversion fonctionne sans connexion, dans les limites de l'offre anonyme en taille de fichier, en pages et en conversions quotidiennes. Se connecter relève ces limites et conserve les fichiers plus longtemps.

Outils associés

D'autres façons de sortir du contenu d'un PDF, ou d'en faire entrer.

Related Guides

Common document management mistakes small business make
General

Common document management mistakes small business make

Discover the most common document management mistakes small businesses make and learn simple ways to organize, store, share, and manage important files efficiently." focus_keyword: Document Management Mistakes

31 août 20265 min read
The Difference Between Storing Documents and Actually Managing Them
General

The Difference Between Storing Documents and Actually Managing Them

Learn the difference between storing documents and actually managing them. Discover how better organization, version control, PDF tools, and workflows save time." focus_keyword: Document Storage vs Document Management

31 août 20265 min read
PDF Techno vs iLovePDF OCR: Which Is More Accurate?
General

PDF Techno vs iLovePDF OCR: Which Is More Accurate?

Compare PDF Techno vs iLovePDF OCR for text accuracy, scanned PDFs, multilingual documents, tables, ease of use, and overall OCR performance.

31 août 20265 min read
PDF Techno vs Smallpdf PDF to JPG: Which Is Better?
General

PDF Techno vs Smallpdf PDF to JPG: Which Is Better?

Compare PDF Techno vs Smallpdf PDF to JPG conversion for image quality, text clarity, scanned documents, file size, ease of use, and overall results.

26 août 20265 min read
Edit PDF vs Repair PDF: What's the Difference and Which One Do You Need?
General

Edit PDF vs Repair PDF: What's the Difference and Which One Do You Need?

Confused between editing a PDF and repairing one? Learn the difference, when to use each option, and how PDF Techno helps you edit and repair PDF files quickly.

15 juil. 20265 min read
PDF Security Checklist: 10 Things You Should Do Before Sharing a File
General

PDF Security Checklist: 10 Things You Should Do Before Sharing a File

Protect your sensitive documents with this PDF security checklist. Learn 10 essential steps to secure your PDF before sharing it online using PDF Techno.

15 juil. 20265 min read