PDF in Markdown umwandeln
Verwandeln Sie jedes PDF in sauberes, strukturiertes Markdown – Überschriften, Tabellen, Listen und Links bleiben erhalten.
PDF-Dateien hier ablegen
Loslassen, um Dateien hinzuzufügen
Ein PDF-Parser, kein Text-Abzug
Die meisten „PDF zu Text“-Werkzeuge liefern eine Wand aus Zeilen in genau der Reihenfolge zurück, in der die Datei sie zufällig gespeichert hat. Dieses hier rekonstruiert das Dokument: welche Zeilen eine Überschrift waren, welcher Block eine Tabelle, welche Spalte zuerst kommt und wo ein Absatz von einem Seitenumbruch zerschnitten wurde.
Reine Textextraktion
Quartalsergebnisse Der Umsatz stieg um 18 % im Jahresvergleich. Die Tabelle Region Q3 Q4 EMEA 4,1 4,8 APAC 2,7 3,9 unten zeigt die Leistung nach Region.
Dieser Konverter
## Quartalsergebnisse Der Umsatz stieg um 18 % im Jahresvergleich. Die Tabelle unten zeigt die Leistung nach Region. | Region | Q3 | Q4 | |--------|-----|-----| | EMEA | 4,1 | 4,8 | | APAC | 2,7 | 3,9 |
Dasselbe PDF. Der Unterschied ist die Struktur: eine Überschriftenebene, eine echte Tabelle und ein Absatz, der um den unterbrechenden Block herum wieder zusammengesetzt wurde.
Was die Umwandlung übersteht
Struktur wird aus der Layout-Geometrie gewonnen, nicht aus der Zeichensetzung erraten.
Überschriften und Listen
Überschriftenebenen ergeben sich aus relativer Schriftgröße und -stärke, sodass eine H2 eine H2 bleibt und nicht zu einem weiteren Absatz wird. Nummerierte und unnummerierte Listen behalten ihre Verschachtelung, und Fett-, Kursiv- und Monospace-Passagen werden als Markdown-Hervorhebung und Code-Spans übernommen.
Tabellen, mit oder ohne Linien
Tabellen mit Rahmen werden anhand ihrer Linien erkannt. Rahmenlose – also solche, die eigentlich nur ausgerichtete Textspalten sind – werden durch Clustering der Zellpositionen gefunden. Genau hier geben die meisten Konverter auf und liefern ein Durcheinander tabulatorgetrennter Fragmente.
Lesereihenfolge bei mehreren Spalten
Eine zweispaltige Seite speichert ihren Text in einem Strom, der zwischen den Spalten hin- und herspringt. Naiv gelesen stammt jede zweite Zeile von der falschen Stelle. Die Spaltengrenzen werden zuerst erkannt, sodass jede Spalte von oben nach unten gelesen wird, bevor die nächste beginnt.
Links und Reparatur von Seitenumbrüchen
Hyperlink-Annotationen werden zu echten Markdown-Links, statt zu nacktem Text abgeflacht zu werden. Absätze, die über eine Seitengrenze hinweg getrennt sind – mit Kopfzeile, Fußzeile und Seitenzahl dazwischen – werden wieder zu einem Absatz zusammengefügt.
Stapelverarbeitung
Senden Sie einen ganzen Ordner voller PDFs als einen Auftrag und erhalten Sie ein ZIP zurück, das jede .md-Datei sowie ein CONVERSION_REPORT.md-Manifest enthält, das festhält, was mit jeder einzelnen geschehen ist. Verfügbar in Tarifen mit aktivierter Stapelverarbeitung.
Standardmäßig privat
Dateien werden über TLS hochgeladen, verarbeitet und automatisch gelöscht, sobald der Aufbewahrungszeitraum Ihres Tarifs abgelaufen ist. Seitenvorschauen werden lokal in Ihrem Browser erzeugt, sodass ein PDF, das Sie doch nicht umwandeln, Ihren Rechner nie verlässt.
Die vier Dinge, an denen PDF-Konverter scheitern
Ein PDF speichert Glyphen an Koordinaten. Absätze, Tabellen oder Lesereihenfolge speichert es nicht – all das muss erschlossen werden. Das hier muss diese Erschließung überstehen.
Zweispaltige Layouts
Das Problem
Wissenschaftliche Aufsätze, Newsletter und Geschäftsberichte setzen Text in Spalten, doch der zugrunde liegende Inhaltsstrom läuft oft quer über die Seite. Extrahiert man ihn in gespeicherter Reihenfolge, erhält man Zeile eins von Spalte A, dann Zeile eins von Spalte B, dann Zeile zwei von Spalte A – ein verschachteltes Durcheinander, das sich wie Kauderwelsch liest. Der Parser erkennt zuerst den senkrechten Zwischenraum und liest jede Spalte als eigenen Block.
Rahmenlose Tabellen
Das Problem
Viele Tabellen haben überhaupt keine gezeichneten Linien; ein Mensch liest sie nur deshalb als Tabelle, weil die Werte bündig stehen. Ohne Linien zum Erkennen bleibt allein die geometrische Analyse, wo Text in jeder Zeile beginnt und endet. Zeilen und Spalten werden aus diesen Ausrichtungen erschlossen und als Markdown-Pipe-Tabellen neu aufgebaut.
Von Seitenumbrüchen zerschnittene Absätze
Das Problem
Ein Satz, der unten auf Seite 4 beginnt und oben auf Seite 5 endet, hat eine laufende Kopfzeile, eine Fußzeile und eine Seitenzahl zwischen seinen beiden Hälften. Diese wiederkehrenden Elemente werden seitenübergreifend erkannt und entfernt, und die beiden Fragmente werden zu einem einzigen Absatz vereint.
Seiten ganz ohne Text
Das Problem
Eine gescannte Seite enthält ein Bild, keine Zeichen – es gibt buchstäblich nichts zu extrahieren. Statt stillschweigend einen leeren Abschnitt auszugeben, werden diese Seiten gezählt und mit Seitenzahl zurückgemeldet, sodass eine kurze Ausgabe erklärt wird, statt wie ein Fehler auszusehen. Mit aktivierter OCR werden sie stattdessen gelesen.
Gescannte Seiten: standardmäßig gemeldet, auf Wunsch lesbar
Hat eine Seite keine Textebene, nennt Ihnen der Konverter die betroffenen Seiten, statt still eine kürzere Datei zu erzeugen. Die optionale OCR liest diese Seiten als Text – standardmäßig deaktiviert, weil sie ein echter Kompromiss ist und keine kostenlose Verbesserung.
Was zurückkommt
Überschriften, Listen, Tabellen und Lesereihenfolge kommen alle zurück, weil sie sich daraus ergeben, wo Wörter auf der Seite stehen, und nicht aus Schriftmetadaten.
Was es kostet
Rund 1,5 Sekunden pro Seite statt etwa 50 Millisekunden – ungefähr dreißigmal langsamer – und begrenzt auf 50 Seiten pro Dokument.
Was nicht zu retten ist
Fett und Kursiv. OCR-Ausgabe enthält keine Schriftinformationen, daher ist die Hervorhebung auf erkannten Seiten endgültig verloren. Erkennungsfehler bei schlechten Scans sind ebenfalls normal.
OCR nutzt dieselbe Tarifberechtigung wie das eigenständige OCR-Werkzeug. So gelesene Seiten werden im Ergebnis gesondert aufgeführt, damit Sie genau wissen, welche Teile des Dokuments Sie prüfen sollten.
Viele Dateien auf einmal umwandeln
Der Stapelmodus geht davon aus, dass in jedem echten Ordner voller PDFs mindestens eine Datei sperrig sein wird.
Ein Auftrag, ein ZIP
Jedes PDF wird zu einer eigenen .md-Datei in einem einzigen Archiv, sodass eine Dokumentationsmigration ein Upload und ein Download ist statt einer eintönigen Schleife.
Eine schlechte Datei kippt nie den Stapel
Ein beschädigtes oder gesperrtes PDF scheitert für sich allein. Der Rest wird normal umgewandelt und bleibt herunterladbar – wegen einer einzigen Datei fangen Sie nie von vorn an.
Ein Protokoll des Geschehens
Die CONVERSION_REPORT.md im ZIP hält das Ergebnis jeder Quelldatei fest: umgewandelte Seiten, Seiten, die Scans waren, und Seiten, die nicht verarbeitet werden konnten.
Ein Passwort pro Datei
Geschützte PDFs teilen sich selten ein Passwort. Jede gesperrte Datei erhält ein eigenes Feld, das vor dem Upload im Browser geprüft wird, sodass ein Tippfehler sofort auffällt und nicht erst nach einer langen Übertragung.
Markdown, reiner Text oder Word?
Alle drei holen Wörter aus einem PDF. Sie unterscheiden sich darin, wie viel von der Gestalt des Dokuments mitkommt – und darin, was Sie danach damit anfangen können.
| Markdown | Reiner Text (.txt) | Word (.docx) | |
|---|---|---|---|
| Überschriften | Als #-Ebenen erhalten | Verloren | Als Formatvorlagen erhalten |
| Tabellen | Markdown-Pipe-Tabellen | Verloren | Erhalten |
| Gut lesbar im Diff | Ja | Ja | Nein – Binärformat |
| Darstellung auf GitHub, in Wikis, Doku-Seiten | Nativ | Als Codeblock | Nicht ohne Umwandlung |
| Gute Eingabe für ein LLM oder einen Suchindex | Am besten – Struktur bleibt | Brauchbar, Struktur fehlt | Erst Extraktion nötig |
| In jedem Texteditor bearbeitbar | Ja | Ja | Nein |
Faustregel: Markdown, wenn der Text gelesen, versioniert oder weiterverarbeitet wird; Word, wenn er neu gesetzt und gedruckt wird.
So wandeln Sie ein PDF in Markdown um
Zum Ausprobieren ist kein Konto nötig und keine Software zu installieren.
PDFs hinzufügen
Ziehen Sie Dateien irgendwo auf die Seite oder nutzen Sie die Auswahl. Jede erhält eine Vorschau der ersten Seite und eine Seitenzahl, lokal in Ihrem Browser erzeugt.
Optionen festlegen
Extrahieren Sie bei Bedarf eingebettete Bilder, aktivieren Sie OCR für gescannte Seiten und geben Sie ein Passwort für jede Datei ein, die als gesperrt angezeigt wird.
Umwandeln
Eine Datei wird sofort umgewandelt. Mehrere werden als Stapel eingereiht und gemeinsam verarbeitet, mit Fortschrittsanzeige nach jeder fertigen Datei.
Herunterladen und Hinweise lesen
Sie erhalten eine .md-Datei oder ein ZIP, wenn Bilder extrahiert oder mehrere Dateien umgewandelt wurden. Lesen Sie den Hinweis, falls einer erscheint – er nennt die Seiten, die Aufmerksamkeit brauchten.
Wo das tatsächlich eingesetzt wird
Überall dort, wo aus einem PDF Text werden muss, mit dem eine Maschine oder eine Versionsverwaltung arbeiten kann.
Dokumentations-Migration
Alte Handbücher, Arbeitsanweisungen und Datenblätter, die in PDF feststecken, wandern mit intakten Überschriften und Tabellen in eine Doku-Seite, ein Wiki oder ein Repository – ohne Abtippen, ohne Nachformatieren.
RAG-Pipelines und LLM-Kontext
Die Qualität des Retrievals hängt stark vom Chunking ab, und Chunking hängt von Struktur ab. Markdown-Überschriften geben einem Splitter echte Grenzen zum Schneiden – etwas, das reiner Text schlicht nicht bietet.
Recherche und Notizen
Holen Sie Aufsätze mit erhaltenen Abschnitten und Tabellen nach Obsidian, Notion oder Logseq, damit Zitate und Abbildungen mit der Überschrift verknüpft bleiben, aus der sie stammen.
Versionierte Dokumente
Markdown lässt sich in Git zeilenweise vergleichen. Ein einmal umgewandelter Vertrag oder eine Richtlinie kann anschließend im selben Arbeitsablauf wie Code verfolgt, geprüft und freigegeben werden.
Inhalte für statische Seiten und CMS
Markdown ist das native Eingabeformat für Hugo, Jekyll, Astro, Docusaurus und die meisten Headless-CMS, sodass umgewandelte Dateien direkt in ein Inhaltsverzeichnis wandern.
Datenextraktion aus Berichten
Geschäftsberichte und Studien vergraben ihre Zahlen in Tabellen. Markdown-Tabellen sind trivial zu parsen, wodurch die Werte für ein Skript erreichbar werden.
Was es nicht leistet
Gut, das vorab zu wissen – denn einem Konverter, der seine Schwächen verschweigt, ist schwerer zu trauen als einem, der sie benennt.
Schwierige Seiten werden gemeldet, nicht versteckt
Seiten, die Scans waren, nicht verarbeitet werden konnten oder sich für die Tabellenerkennung als zu komplex erwiesen, werden im Ergebnis jeweils mit Seitenzahl genannt. Komplexe Seiten liefern ihren Text weiterhin als Absätze – verloren geht die Tabellenform.
Größen- und Seitenlimits kommen aus Ihrem Tarif
Maximale Dateigröße, Seiten pro Dokument und Dateien pro Stapel werden alle von Ihrem Tarif bestimmt und im Bereich neben dem Upload angezeigt. Der gezeigte Wert ist immer Ihr aktueller.
Verschlüsselte Dateien brauchen ihr Passwort
Ein gesperrtes PDF lässt sich ohne Passwort nicht lesen. Passwörter werden für diese eine Umwandlung genutzt, zuvor im Browser geprüft und nie gespeichert.
Häufige Fragen
Funktioniert es bei gescannten PDFs?
Nicht ohne OCR, denn eine gescannte Seite enthält ein Bild statt Zeichen – es gibt nichts zu extrahieren. Der Konverter nennt Ihnen genau, welche Seiten Scans waren, und mit aktivierter OCR werden sie stattdessen gelesen. Rechnen Sie mit deutlich längerer Laufzeit und damit, dass Fett und Kursiv auf diesen Seiten verloren gehen.
Bleiben Tabellen wirklich erhalten oder werden sie nur angenähert?
Sowohl Tabellen mit Linien als auch rahmenlose, spaltenweise ausgerichtete Layouts werden erkannt und als Markdown-Pipe-Tabellen neu aufgebaut. Sehr komplexe Seiten – verbundene Zellen, verschachtelte Tabellen, starke visuelle Gestaltung – fallen auf reine Absätze zurück, und diese Seiten werden im Ergebnis aufgeführt, damit Sie wissen, welche Sie prüfen sollten.
Was passiert mit Bildern im PDF?
Standardmäßig werden sie übersprungen und Sie erhalten eine einzelne .md-Datei. Aktivieren Sie „Eingebettete Bilder extrahieren“, und das Ergebnis ist ein ZIP mit Ihrem Markdown und einem images/-Ordner, wobei das Markdown auf jede extrahierte Datei verweist.
Kann ich mehrere PDFs auf einmal umwandeln?
Ja, in einem Tarif mit aktivierter Stapelverarbeitung. Die Dateien werden als ein Auftrag eingereiht und als ZIP mit einem Umwandlungsbericht zurückgegeben. Ohne diese Tarifoption können Sie beliebig viele Dateien weiterhin einzeln umwandeln.
Wie geht es mit zweispaltigen wissenschaftlichen Aufsätzen um?
Die Spaltengrenzen werden erkannt, bevor Text gelesen wird, sodass jede Spalte nacheinander von oben nach unten verarbeitet wird. Ohne diesen Schritt springt die Extraktion zeilenweise zwischen den Spalten und die Ausgabe ist unbrauchbar – deshalb tun sich so viele Werkzeuge gerade mit Aufsätzen schwer.
Kann ich ein passwortgeschütztes PDF umwandeln?
Ja. Gesperrte Dateien zeigen ein Passwortfeld auf ihrer eigenen Karte, und das Passwort wird im Browser geprüft, bevor irgendetwas hochgeladen wird – ein falsches fällt also sofort auf. In einem Stapel kann jede Datei ein eigenes Passwort haben.
Wie groß darf eine Datei sein?
Das hängt von Ihrem Tarif ab. Das unter dem Upload-Bereich gezeigte Limit ist Ihr aktuelles und wird live aus Ihrem Konto gelesen statt fest vorgegeben zu sein – ein Upgrade hebt es also sofort an.
Ist das Markdown so, wie es ist, veröffentlichungsreif?
Meist nahe dran. Überschriften, Listen, Tabellen und Links kommen sauber durch, und die Ausgabe ist Standard-CommonMark, das auf GitHub, in Wikis und in Static-Site-Generatoren dargestellt wird. Dokumente mit ungewöhnlichem Layout sind ein kurzes Gegenlesen wert, und der Ergebnishinweis sagt Ihnen, wo Sie schauen sollten.
Wie lange werden meine Dateien aufbewahrt?
Uploads und umgewandelte Ausgaben werden nach dem Aufbewahrungszeitraum Ihres Tarifs automatisch gelöscht; er wird unter dem Upload-Bereich angezeigt. Sie können eine umgewandelte Datei auch sofort über den Download-Bildschirm löschen.
Brauche ich ein Konto?
Nein. Die Umwandlung funktioniert ohne Anmeldung, im Rahmen der Limits des anonymen Tarifs für Dateigröße, Seiten und tägliche Umwandlungen. Eine Anmeldung hebt diese Limits an und bewahrt Ihre Dateien länger auf.
Verwandte Werkzeuge
Weitere Wege, Inhalte aus einem PDF heraus- oder in ein PDF hineinzubekommen.
Related Guides

Common document management mistakes small business make
Discover the most common document management mistakes small businesses make and learn simple ways to organize, store, share, and manage important files efficiently." focus_keyword: Document Management Mistakes

The Difference Between Storing Documents and Actually Managing Them
Learn the difference between storing documents and actually managing them. Discover how better organization, version control, PDF tools, and workflows save time." focus_keyword: Document Storage vs Document Management

PDF Techno vs iLovePDF OCR: Which Is More Accurate?
Compare PDF Techno vs iLovePDF OCR for text accuracy, scanned PDFs, multilingual documents, tables, ease of use, and overall OCR performance.

PDF Techno vs Smallpdf PDF to JPG: Which Is Better?
Compare PDF Techno vs Smallpdf PDF to JPG conversion for image quality, text clarity, scanned documents, file size, ease of use, and overall results.

Edit PDF vs Repair PDF: What's the Difference and Which One Do You Need?
Confused between editing a PDF and repairing one? Learn the difference, when to use each option, and how PDF Techno helps you edit and repair PDF files quickly.

PDF Security Checklist: 10 Things You Should Do Before Sharing a File
Protect your sensitive documents with this PDF security checklist. Learn 10 essential steps to secure your PDF before sharing it online using PDF Techno.