PDF in Markdown umwandeln

Verwandeln Sie jedes PDF in sauberes, strukturiertes Markdown – Überschriften, Tabellen, Listen und Links bleiben erhalten.

Tabellen & Überschriften bleiben erhalten
Stapelverarbeitung
Sicher & privat

PDF-Dateien hier ablegen

Loslassen, um Dateien hinzuzufügen

Ein PDF-Parser, kein Text-Abzug

Die meisten „PDF zu Text“-Werkzeuge liefern eine Wand aus Zeilen in genau der Reihenfolge zurück, in der die Datei sie zufällig gespeichert hat. Dieses hier rekonstruiert das Dokument: welche Zeilen eine Überschrift waren, welcher Block eine Tabelle, welche Spalte zuerst kommt und wo ein Absatz von einem Seitenumbruch zerschnitten wurde.

Reine Textextraktion

Quartalsergebnisse
Der Umsatz stieg um 18 % im
Jahresvergleich. Die Tabelle
Region Q3 Q4
EMEA 4,1 4,8
APAC 2,7 3,9
unten zeigt die Leistung nach
Region.

Dieser Konverter

## Quartalsergebnisse

Der Umsatz stieg um 18 % im
Jahresvergleich. Die Tabelle unten
zeigt die Leistung nach Region.

| Region | Q3  | Q4  |
|--------|-----|-----|
| EMEA   | 4,1 | 4,8 |
| APAC   | 2,7 | 3,9 |

Dasselbe PDF. Der Unterschied ist die Struktur: eine Überschriftenebene, eine echte Tabelle und ein Absatz, der um den unterbrechenden Block herum wieder zusammengesetzt wurde.

Was die Umwandlung übersteht

Struktur wird aus der Layout-Geometrie gewonnen, nicht aus der Zeichensetzung erraten.

Überschriften und Listen

Überschriftenebenen ergeben sich aus relativer Schriftgröße und -stärke, sodass eine H2 eine H2 bleibt und nicht zu einem weiteren Absatz wird. Nummerierte und unnummerierte Listen behalten ihre Verschachtelung, und Fett-, Kursiv- und Monospace-Passagen werden als Markdown-Hervorhebung und Code-Spans übernommen.

Tabellen, mit oder ohne Linien

Tabellen mit Rahmen werden anhand ihrer Linien erkannt. Rahmenlose – also solche, die eigentlich nur ausgerichtete Textspalten sind – werden durch Clustering der Zellpositionen gefunden. Genau hier geben die meisten Konverter auf und liefern ein Durcheinander tabulatorgetrennter Fragmente.

Lesereihenfolge bei mehreren Spalten

Eine zweispaltige Seite speichert ihren Text in einem Strom, der zwischen den Spalten hin- und herspringt. Naiv gelesen stammt jede zweite Zeile von der falschen Stelle. Die Spaltengrenzen werden zuerst erkannt, sodass jede Spalte von oben nach unten gelesen wird, bevor die nächste beginnt.

Links und Reparatur von Seitenumbrüchen

Hyperlink-Annotationen werden zu echten Markdown-Links, statt zu nacktem Text abgeflacht zu werden. Absätze, die über eine Seitengrenze hinweg getrennt sind – mit Kopfzeile, Fußzeile und Seitenzahl dazwischen – werden wieder zu einem Absatz zusammengefügt.

Stapelverarbeitung

Senden Sie einen ganzen Ordner voller PDFs als einen Auftrag und erhalten Sie ein ZIP zurück, das jede .md-Datei sowie ein CONVERSION_REPORT.md-Manifest enthält, das festhält, was mit jeder einzelnen geschehen ist. Verfügbar in Tarifen mit aktivierter Stapelverarbeitung.

Standardmäßig privat

Dateien werden über TLS hochgeladen, verarbeitet und automatisch gelöscht, sobald der Aufbewahrungszeitraum Ihres Tarifs abgelaufen ist. Seitenvorschauen werden lokal in Ihrem Browser erzeugt, sodass ein PDF, das Sie doch nicht umwandeln, Ihren Rechner nie verlässt.

Die vier Dinge, an denen PDF-Konverter scheitern

Ein PDF speichert Glyphen an Koordinaten. Absätze, Tabellen oder Lesereihenfolge speichert es nicht – all das muss erschlossen werden. Das hier muss diese Erschließung überstehen.

Zweispaltige Layouts

Das Problem

Wissenschaftliche Aufsätze, Newsletter und Geschäftsberichte setzen Text in Spalten, doch der zugrunde liegende Inhaltsstrom läuft oft quer über die Seite. Extrahiert man ihn in gespeicherter Reihenfolge, erhält man Zeile eins von Spalte A, dann Zeile eins von Spalte B, dann Zeile zwei von Spalte A – ein verschachteltes Durcheinander, das sich wie Kauderwelsch liest. Der Parser erkennt zuerst den senkrechten Zwischenraum und liest jede Spalte als eigenen Block.

Rahmenlose Tabellen

Das Problem

Viele Tabellen haben überhaupt keine gezeichneten Linien; ein Mensch liest sie nur deshalb als Tabelle, weil die Werte bündig stehen. Ohne Linien zum Erkennen bleibt allein die geometrische Analyse, wo Text in jeder Zeile beginnt und endet. Zeilen und Spalten werden aus diesen Ausrichtungen erschlossen und als Markdown-Pipe-Tabellen neu aufgebaut.

Von Seitenumbrüchen zerschnittene Absätze

Das Problem

Ein Satz, der unten auf Seite 4 beginnt und oben auf Seite 5 endet, hat eine laufende Kopfzeile, eine Fußzeile und eine Seitenzahl zwischen seinen beiden Hälften. Diese wiederkehrenden Elemente werden seitenübergreifend erkannt und entfernt, und die beiden Fragmente werden zu einem einzigen Absatz vereint.

Seiten ganz ohne Text

Das Problem

Eine gescannte Seite enthält ein Bild, keine Zeichen – es gibt buchstäblich nichts zu extrahieren. Statt stillschweigend einen leeren Abschnitt auszugeben, werden diese Seiten gezählt und mit Seitenzahl zurückgemeldet, sodass eine kurze Ausgabe erklärt wird, statt wie ein Fehler auszusehen. Mit aktivierter OCR werden sie stattdessen gelesen.

Gescannte Seiten: standardmäßig gemeldet, auf Wunsch lesbar

Hat eine Seite keine Textebene, nennt Ihnen der Konverter die betroffenen Seiten, statt still eine kürzere Datei zu erzeugen. Die optionale OCR liest diese Seiten als Text – standardmäßig deaktiviert, weil sie ein echter Kompromiss ist und keine kostenlose Verbesserung.

Was zurückkommt

Überschriften, Listen, Tabellen und Lesereihenfolge kommen alle zurück, weil sie sich daraus ergeben, wo Wörter auf der Seite stehen, und nicht aus Schriftmetadaten.

Was es kostet

Rund 1,5 Sekunden pro Seite statt etwa 50 Millisekunden – ungefähr dreißigmal langsamer – und begrenzt auf 50 Seiten pro Dokument.

Was nicht zu retten ist

Fett und Kursiv. OCR-Ausgabe enthält keine Schriftinformationen, daher ist die Hervorhebung auf erkannten Seiten endgültig verloren. Erkennungsfehler bei schlechten Scans sind ebenfalls normal.

OCR nutzt dieselbe Tarifberechtigung wie das eigenständige OCR-Werkzeug. So gelesene Seiten werden im Ergebnis gesondert aufgeführt, damit Sie genau wissen, welche Teile des Dokuments Sie prüfen sollten.

Viele Dateien auf einmal umwandeln

Der Stapelmodus geht davon aus, dass in jedem echten Ordner voller PDFs mindestens eine Datei sperrig sein wird.

1

Ein Auftrag, ein ZIP

Jedes PDF wird zu einer eigenen .md-Datei in einem einzigen Archiv, sodass eine Dokumentationsmigration ein Upload und ein Download ist statt einer eintönigen Schleife.

2

Eine schlechte Datei kippt nie den Stapel

Ein beschädigtes oder gesperrtes PDF scheitert für sich allein. Der Rest wird normal umgewandelt und bleibt herunterladbar – wegen einer einzigen Datei fangen Sie nie von vorn an.

3

Ein Protokoll des Geschehens

Die CONVERSION_REPORT.md im ZIP hält das Ergebnis jeder Quelldatei fest: umgewandelte Seiten, Seiten, die Scans waren, und Seiten, die nicht verarbeitet werden konnten.

4

Ein Passwort pro Datei

Geschützte PDFs teilen sich selten ein Passwort. Jede gesperrte Datei erhält ein eigenes Feld, das vor dem Upload im Browser geprüft wird, sodass ein Tippfehler sofort auffällt und nicht erst nach einer langen Übertragung.

Markdown, reiner Text oder Word?

Alle drei holen Wörter aus einem PDF. Sie unterscheiden sich darin, wie viel von der Gestalt des Dokuments mitkommt – und darin, was Sie danach damit anfangen können.

MarkdownReiner Text (.txt)Word (.docx)
ÜberschriftenAls #-Ebenen erhaltenVerlorenAls Formatvorlagen erhalten
TabellenMarkdown-Pipe-TabellenVerlorenErhalten
Gut lesbar im DiffJaJaNein – Binärformat
Darstellung auf GitHub, in Wikis, Doku-SeitenNativAls CodeblockNicht ohne Umwandlung
Gute Eingabe für ein LLM oder einen SuchindexAm besten – Struktur bleibtBrauchbar, Struktur fehltErst Extraktion nötig
In jedem Texteditor bearbeitbarJaJaNein

Faustregel: Markdown, wenn der Text gelesen, versioniert oder weiterverarbeitet wird; Word, wenn er neu gesetzt und gedruckt wird.

So wandeln Sie ein PDF in Markdown um

Zum Ausprobieren ist kein Konto nötig und keine Software zu installieren.

1

PDFs hinzufügen

Ziehen Sie Dateien irgendwo auf die Seite oder nutzen Sie die Auswahl. Jede erhält eine Vorschau der ersten Seite und eine Seitenzahl, lokal in Ihrem Browser erzeugt.

2

Optionen festlegen

Extrahieren Sie bei Bedarf eingebettete Bilder, aktivieren Sie OCR für gescannte Seiten und geben Sie ein Passwort für jede Datei ein, die als gesperrt angezeigt wird.

3

Umwandeln

Eine Datei wird sofort umgewandelt. Mehrere werden als Stapel eingereiht und gemeinsam verarbeitet, mit Fortschrittsanzeige nach jeder fertigen Datei.

4

Herunterladen und Hinweise lesen

Sie erhalten eine .md-Datei oder ein ZIP, wenn Bilder extrahiert oder mehrere Dateien umgewandelt wurden. Lesen Sie den Hinweis, falls einer erscheint – er nennt die Seiten, die Aufmerksamkeit brauchten.

Wo das tatsächlich eingesetzt wird

Überall dort, wo aus einem PDF Text werden muss, mit dem eine Maschine oder eine Versionsverwaltung arbeiten kann.

Dokumentations-Migration

Alte Handbücher, Arbeitsanweisungen und Datenblätter, die in PDF feststecken, wandern mit intakten Überschriften und Tabellen in eine Doku-Seite, ein Wiki oder ein Repository – ohne Abtippen, ohne Nachformatieren.

RAG-Pipelines und LLM-Kontext

Die Qualität des Retrievals hängt stark vom Chunking ab, und Chunking hängt von Struktur ab. Markdown-Überschriften geben einem Splitter echte Grenzen zum Schneiden – etwas, das reiner Text schlicht nicht bietet.

Recherche und Notizen

Holen Sie Aufsätze mit erhaltenen Abschnitten und Tabellen nach Obsidian, Notion oder Logseq, damit Zitate und Abbildungen mit der Überschrift verknüpft bleiben, aus der sie stammen.

Versionierte Dokumente

Markdown lässt sich in Git zeilenweise vergleichen. Ein einmal umgewandelter Vertrag oder eine Richtlinie kann anschließend im selben Arbeitsablauf wie Code verfolgt, geprüft und freigegeben werden.

Inhalte für statische Seiten und CMS

Markdown ist das native Eingabeformat für Hugo, Jekyll, Astro, Docusaurus und die meisten Headless-CMS, sodass umgewandelte Dateien direkt in ein Inhaltsverzeichnis wandern.

Datenextraktion aus Berichten

Geschäftsberichte und Studien vergraben ihre Zahlen in Tabellen. Markdown-Tabellen sind trivial zu parsen, wodurch die Werte für ein Skript erreichbar werden.

Was es nicht leistet

Gut, das vorab zu wissen – denn einem Konverter, der seine Schwächen verschweigt, ist schwerer zu trauen als einem, der sie benennt.

Schwierige Seiten werden gemeldet, nicht versteckt

Seiten, die Scans waren, nicht verarbeitet werden konnten oder sich für die Tabellenerkennung als zu komplex erwiesen, werden im Ergebnis jeweils mit Seitenzahl genannt. Komplexe Seiten liefern ihren Text weiterhin als Absätze – verloren geht die Tabellenform.

Größen- und Seitenlimits kommen aus Ihrem Tarif

Maximale Dateigröße, Seiten pro Dokument und Dateien pro Stapel werden alle von Ihrem Tarif bestimmt und im Bereich neben dem Upload angezeigt. Der gezeigte Wert ist immer Ihr aktueller.

Verschlüsselte Dateien brauchen ihr Passwort

Ein gesperrtes PDF lässt sich ohne Passwort nicht lesen. Passwörter werden für diese eine Umwandlung genutzt, zuvor im Browser geprüft und nie gespeichert.

Häufige Fragen

Funktioniert es bei gescannten PDFs?

Nicht ohne OCR, denn eine gescannte Seite enthält ein Bild statt Zeichen – es gibt nichts zu extrahieren. Der Konverter nennt Ihnen genau, welche Seiten Scans waren, und mit aktivierter OCR werden sie stattdessen gelesen. Rechnen Sie mit deutlich längerer Laufzeit und damit, dass Fett und Kursiv auf diesen Seiten verloren gehen.

Bleiben Tabellen wirklich erhalten oder werden sie nur angenähert?

Sowohl Tabellen mit Linien als auch rahmenlose, spaltenweise ausgerichtete Layouts werden erkannt und als Markdown-Pipe-Tabellen neu aufgebaut. Sehr komplexe Seiten – verbundene Zellen, verschachtelte Tabellen, starke visuelle Gestaltung – fallen auf reine Absätze zurück, und diese Seiten werden im Ergebnis aufgeführt, damit Sie wissen, welche Sie prüfen sollten.

Was passiert mit Bildern im PDF?

Standardmäßig werden sie übersprungen und Sie erhalten eine einzelne .md-Datei. Aktivieren Sie „Eingebettete Bilder extrahieren“, und das Ergebnis ist ein ZIP mit Ihrem Markdown und einem images/-Ordner, wobei das Markdown auf jede extrahierte Datei verweist.

Kann ich mehrere PDFs auf einmal umwandeln?

Ja, in einem Tarif mit aktivierter Stapelverarbeitung. Die Dateien werden als ein Auftrag eingereiht und als ZIP mit einem Umwandlungsbericht zurückgegeben. Ohne diese Tarifoption können Sie beliebig viele Dateien weiterhin einzeln umwandeln.

Wie geht es mit zweispaltigen wissenschaftlichen Aufsätzen um?

Die Spaltengrenzen werden erkannt, bevor Text gelesen wird, sodass jede Spalte nacheinander von oben nach unten verarbeitet wird. Ohne diesen Schritt springt die Extraktion zeilenweise zwischen den Spalten und die Ausgabe ist unbrauchbar – deshalb tun sich so viele Werkzeuge gerade mit Aufsätzen schwer.

Kann ich ein passwortgeschütztes PDF umwandeln?

Ja. Gesperrte Dateien zeigen ein Passwortfeld auf ihrer eigenen Karte, und das Passwort wird im Browser geprüft, bevor irgendetwas hochgeladen wird – ein falsches fällt also sofort auf. In einem Stapel kann jede Datei ein eigenes Passwort haben.

Wie groß darf eine Datei sein?

Das hängt von Ihrem Tarif ab. Das unter dem Upload-Bereich gezeigte Limit ist Ihr aktuelles und wird live aus Ihrem Konto gelesen statt fest vorgegeben zu sein – ein Upgrade hebt es also sofort an.

Ist das Markdown so, wie es ist, veröffentlichungsreif?

Meist nahe dran. Überschriften, Listen, Tabellen und Links kommen sauber durch, und die Ausgabe ist Standard-CommonMark, das auf GitHub, in Wikis und in Static-Site-Generatoren dargestellt wird. Dokumente mit ungewöhnlichem Layout sind ein kurzes Gegenlesen wert, und der Ergebnishinweis sagt Ihnen, wo Sie schauen sollten.

Wie lange werden meine Dateien aufbewahrt?

Uploads und umgewandelte Ausgaben werden nach dem Aufbewahrungszeitraum Ihres Tarifs automatisch gelöscht; er wird unter dem Upload-Bereich angezeigt. Sie können eine umgewandelte Datei auch sofort über den Download-Bildschirm löschen.

Brauche ich ein Konto?

Nein. Die Umwandlung funktioniert ohne Anmeldung, im Rahmen der Limits des anonymen Tarifs für Dateigröße, Seiten und tägliche Umwandlungen. Eine Anmeldung hebt diese Limits an und bewahrt Ihre Dateien länger auf.

Verwandte Werkzeuge

Weitere Wege, Inhalte aus einem PDF heraus- oder in ein PDF hineinzubekommen.

Related Guides

Common document management mistakes small business make
General

Common document management mistakes small business make

Discover the most common document management mistakes small businesses make and learn simple ways to organize, store, share, and manage important files efficiently." focus_keyword: Document Management Mistakes

31. Aug. 20265 min read
The Difference Between Storing Documents and Actually Managing Them
General

The Difference Between Storing Documents and Actually Managing Them

Learn the difference between storing documents and actually managing them. Discover how better organization, version control, PDF tools, and workflows save time." focus_keyword: Document Storage vs Document Management

31. Aug. 20265 min read
PDF Techno vs iLovePDF OCR: Which Is More Accurate?
General

PDF Techno vs iLovePDF OCR: Which Is More Accurate?

Compare PDF Techno vs iLovePDF OCR for text accuracy, scanned PDFs, multilingual documents, tables, ease of use, and overall OCR performance.

31. Aug. 20265 min read
PDF Techno vs Smallpdf PDF to JPG: Which Is Better?
General

PDF Techno vs Smallpdf PDF to JPG: Which Is Better?

Compare PDF Techno vs Smallpdf PDF to JPG conversion for image quality, text clarity, scanned documents, file size, ease of use, and overall results.

26. Aug. 20265 min read
Edit PDF vs Repair PDF: What's the Difference and Which One Do You Need?
General

Edit PDF vs Repair PDF: What's the Difference and Which One Do You Need?

Confused between editing a PDF and repairing one? Learn the difference, when to use each option, and how PDF Techno helps you edit and repair PDF files quickly.

15. Juli 20265 min read
PDF Security Checklist: 10 Things You Should Do Before Sharing a File
General

PDF Security Checklist: 10 Things You Should Do Before Sharing a File

Protect your sensitive documents with this PDF security checklist. Learn 10 essential steps to secure your PDF before sharing it online using PDF Techno.

15. Juli 20265 min read