PDF naar Markdown converteren

Zet elke PDF om in schone, gestructureerde Markdown: koppen, tabellen, lijsten en links blijven behouden.

Tabellen en koppen blijven behouden
Batchconversie
Veilig en privé

Zet PDF-bestanden hier neer

Laat los om bestanden toe te voegen

Een PDF-parser, geen tekstdump

De meeste «PDF naar tekst»-hulpmiddelen leveren een muur van regels op in de volgorde waarin het bestand ze toevallig heeft opgeslagen. Dit hulpmiddel reconstrueert het document: welke regels een kop waren, welk blok een tabel was, welke kolom eerst komt en waar een pagina-einde een alinea doormidden heeft gesneden.

Platte tekstextractie

Kwartaalresultaten
De omzet groeide met 18 % op
jaarbasis. De tabel hieronder
Regio K3 K4
EMEA 4,1 4,8
APAC 2,7 3,9
splitst de prestaties uit per
regio.

Deze converter

## Kwartaalresultaten

De omzet groeide met 18 % op
jaarbasis. De tabel hieronder splitst
de prestaties uit per regio.

| Regio | K3  | K4  |
|-------|-----|-----|
| EMEA  | 4,1 | 4,8 |
| APAC  | 2,7 | 3,9 |

Dezelfde PDF. Het verschil is structuur: een kopniveau, een echte tabel en een alinea die weer is samengevoegd rond het blok dat hem onderbrak.

Wat de conversie overleeft

Structuur wordt afgeleid uit de geometrie van de opmaak, niet geraden uit leestekens.

Koppen en lijsten

Kopniveaus volgen uit de relatieve lettergrootte en -dikte, zodat een H2 een H2 blijft in plaats van nog een alinea te worden. Genummerde en ongenummerde lijsten behouden hun nesting, en stukken vet, cursief en monospace komen mee als Markdown-nadruk en code in de tekst.

Tabellen, met of zonder lijnen

Tabellen met randen worden herkend aan hun lijnen. Tabellen zonder randen — in feite gewoon uitgelijnde tekstkolommen — worden gevonden door de celposities te clusteren, en precies daar geven de meeste converters het op en leveren ze een brij van door tabs gescheiden fragmenten.

Leesvolgorde bij meerdere kolommen

Een pagina met twee kolommen slaat de tekst op in één stroom die tussen de kolommen heen en weer springt. Naïef gelezen komt elke tweede regel van de verkeerde plek. De kolomgrenzen worden eerst bepaald, zodat elke kolom van boven naar beneden wordt gelezen voordat de volgende begint.

Links en herstel van pagina-einden

Hyperlink-annotaties worden echte Markdown-links in plaats van te worden platgeslagen tot kale tekst. Alinea's die door een paginagrens zijn gesplitst — met een koptekst, voettekst en paginanummer ertussen geklemd — worden weer tot één alinea aaneengeregen.

Batchconversie

Stuur een hele map met PDF's als één taak en ontvang een ZIP met elk .md-bestand plus een CONVERSION_REPORT.md-manifest dat vastlegt wat er met elk bestand is gebeurd. Beschikbaar bij abonnementen met batchverwerking ingeschakeld.

Standaard privé

Bestanden worden via TLS geüpload, verwerkt en automatisch verwijderd zodra de bewaartermijn van uw abonnement is verstreken. Paginavoorbeelden worden lokaal in uw browser gemaakt, dus een PDF die u toch niet converteert verlaat uw computer nooit.

De vier dingen waarop PDF-converters stuklopen

Een PDF slaat lettertekens op coördinaten op. Alinea's, tabellen of leesvolgorde slaat hij niet op — dat moet allemaal worden afgeleid. Dit is wat die afleiding moet doorstaan.

Indelingen met twee kolommen

Het probleem

Wetenschappelijke artikelen, nieuwsbrieven en jaarverslagen zetten tekst in kolommen, maar de onderliggende inhoudsstroom loopt vaak dwars over de pagina. Wie in opgeslagen volgorde extraheert, krijgt regel één van kolom A, dan regel één van kolom B, dan regel twee van kolom A — een verweven warboel die als koeterwaals leest. De parser bepaalt eerst de verticale tussenruimte en leest elke kolom als een apart blok.

Tabellen zonder lijnen

Het probleem

Heel wat tabellen hebben helemaal geen getekende lijnen; een mens leest ze uitsluitend als tabel omdat de waarden zijn uitgelijnd. Zonder lijnen om te herkennen is geometrische analyse van waar tekst op elke regel begint en eindigt het enige signaal. Rijen en kolommen worden uit die uitlijning afgeleid en herbouwd als Markdown-tabellen.

Alinea's doorsneden door pagina-einden

Het probleem

Een zin die onderaan pagina 4 begint en bovenaan pagina 5 eindigt, heeft een doorlopende koptekst, een voettekst en een paginanummer tussen zijn twee helften. Die terugkerende elementen worden over pagina's heen herkend en verwijderd, en de twee fragmenten worden tot één alinea samengevoegd.

Pagina's zonder enige tekst

Het probleem

Een gescande pagina bevat een afbeelding, geen tekens — er valt letterlijk niets te extraheren. In plaats van stilzwijgend een leeg gedeelte op te leveren, worden die pagina's geteld en per nummer gemeld, zodat een korte uitvoer verklaard wordt in plaats van op een fout te lijken. Zet OCR aan en ze worden alsnog gelezen.

Gescande pagina's: standaard gemeld, op verzoek leesbaar

Heeft een pagina geen tekstlaag, dan vertelt de converter welke pagina's het betreft in plaats van stilletjes een korter bestand te maken. De optionele OCR leest die pagina's als tekst — standaard uit, omdat het een echte afweging is en geen gratis verbetering.

Wat het terughaalt

Koppen, lijsten, tabellen en leesvolgorde komen allemaal terug, omdat ze worden afgeleid uit waar woorden op de pagina staan en niet uit lettertypemetadata.

Wat het kost

Ongeveer 1,5 seconde per pagina tegenover zo'n 50 milliseconden zonder — ruwweg dertig keer trager — en het is begrensd op 50 pagina's per document.

Wat niet te redden is

Vet en cursief. OCR-uitvoer bevat geen lettertype-informatie, dus nadruk op herkende pagina's is definitief weg. Herkenningsfouten bij slechte scans zijn eveneens normaal.

OCR gebruikt hetzelfde abonnementsrecht als het losse OCR-hulpmiddel. Zo gelezen pagina's staan apart vermeld in het resultaat, zodat u precies weet welke delen van het document u moet nakijken.

Veel bestanden tegelijk converteren

De batchmodus gaat ervan uit dat in elke echte map met PDF's minstens één bestand lastig zal zijn.

1

Eén taak, één ZIP

Elke PDF wordt een eigen .md-bestand binnen één archief, zodat een documentatiemigratie één upload en één download is in plaats van een eentonige herhaling.

2

Eén slecht bestand laat de batch nooit kapseizen

Een beschadigde of vergrendelde PDF mislukt op zichzelf. De rest wordt gewoon geconverteerd en blijft te downloaden — u begint nooit opnieuw vanwege één bestand.

3

Een verslag van wat er gebeurde

CONVERSION_REPORT.md in de ZIP legt de uitkomst van elk bronbestand vast: geconverteerde pagina's, pagina's die scans waren en pagina's die niet konden worden verwerkt.

4

Een wachtwoord per bestand

Beveiligde PDF's delen zelden hetzelfde wachtwoord. Elk vergrendeld bestand krijgt een eigen veld, dat vóór het uploaden in uw browser wordt gecontroleerd, zodat een typefout meteen opvalt en niet pas na een lange overdracht.

Markdown, platte tekst of Word?

Alle drie halen woorden uit een PDF. Ze verschillen in hoeveel van de vorm van het document meekomt, en in wat u er daarna mee kunt.

MarkdownPlatte tekst (.txt)Word (.docx)
KoppenBehouden als #-niveausVerlorenBehouden als stijlen
TabellenMarkdown-tabellenVerlorenBehouden
Leest goed in een diffJaJaNee — binair formaat
Wordt getoond op GitHub, wiki's en documentatiesitesVan natureAls codeblokNiet zonder conversie
Goede invoer voor een LLM of zoekindexBeste — structuur blijftBruikbaar, structuur wegVereist eerst extractie
Bewerkbaar in elke teksteditorJaJaNee

Vuistregel: Markdown wanneer de tekst gelezen, in versiebeheer gezet of verder verwerkt wordt; Word wanneer hij opnieuw wordt opgemaakt en gedrukt.

Zo converteert u een PDF naar Markdown

Geen account nodig om het te proberen en geen software om te installeren.

1

Voeg uw PDF's toe

Sleep bestanden ergens op de pagina of gebruik de kiezer. Elk bestand krijgt een miniatuur van de eerste pagina en een paginateller, lokaal gemaakt in uw browser.

2

Stel de opties in

Extraheer desgewenst ingesloten afbeeldingen, zet OCR aan voor gescande pagina's en voer een wachtwoord in voor elk bestand dat als vergrendeld wordt getoond.

3

Converteer

Eén bestand wordt meteen geconverteerd. Meerdere bestanden komen als batch in de wachtrij en worden samen verwerkt, met voortgang zodra elk bestand klaar is.

4

Download en lees de opmerkingen

U krijgt een .md-bestand, of een ZIP als er afbeeldingen zijn geëxtraheerd of meerdere bestanden zijn geconverteerd. Lees de melding als die verschijnt: die vertelt welke pagina's aandacht vroegen.

Waar dit echt voor wordt gebruikt

Overal waar een PDF tekst moet worden waarmee een machine of versiebeheer kan werken.

Documentatiemigratie

Oude handleidingen, werkinstructies en specificatiebladen die in PDF vastzitten, verhuizen met koppen en tabellen intact naar een documentatiesite, wiki of repository — zonder overtypen en zonder herformatteerronde.

RAG-pijplijnen en LLM-context

De kwaliteit van retrieval hangt sterk af van chunking, en chunking hangt af van structuur. Markdown-koppen geven een splitter echte grenzen om op te knippen, iets wat platte tekst eenvoudigweg niet biedt.

Onderzoek en aantekeningen

Haal artikelen naar Obsidian, Notion of Logseq met secties en tabellen intact, zodat citaten en figuren gekoppeld blijven aan de kop waar ze vandaan komen.

Documenten in versiebeheer

Markdown vergelijkt regel voor regel in git. Een eenmaal geconverteerd contract of beleidsstuk kan daarna via dezelfde werkwijze als code worden gevolgd, beoordeeld en goedgekeurd.

Inhoud voor statische sites en CMS'en

Markdown is de eigen invoer van Hugo, Jekyll, Astro, Docusaurus en de meeste headless CMS'en, dus geconverteerde bestanden vallen rechtstreeks in een contentmap.

Gegevens uit rapporten halen

Jaarrekeningen en onderzoeksrapporten begraven hun cijfers in tabellen. Markdown-tabellen zijn triviaal te parseren, waardoor die getallen bereikbaar worden voor een script.

Wat het niet doet

Goed om vooraf te weten, want een converter die zijn zwakke plekken verzwijgt is lastiger te vertrouwen dan een die ze benoemt.

Lastige pagina's worden gemeld, niet verborgen

Pagina's die scans waren, die niet konden worden verwerkt of die te complex bleken voor tabelherkenning worden elk per nummer in het resultaat vermeld. Complexe pagina's leveren hun tekst nog steeds als alinea's — wat verloren gaat, is de tabelvorm.

Limieten voor grootte en pagina's komen uit uw abonnement

Maximale bestandsgrootte, pagina's per document en bestanden per batch worden allemaal door uw abonnement bepaald en getoond in het paneel naast het uploadvak. Het getoonde cijfer is altijd uw huidige.

Versleutelde bestanden hebben hun wachtwoord nodig

Een vergrendelde PDF is er niet zonder te lezen. Wachtwoorden worden voor die ene conversie gebruikt, vooraf in uw browser gecontroleerd en nooit opgeslagen.

Veelgestelde vragen

Werkt het bij gescande PDF's?

Niet zonder OCR, want een gescande pagina bevat een afbeelding in plaats van tekens — er valt niets te extraheren. De converter vertelt precies welke pagina's scans waren, en met OCR aan worden ze alsnog gelezen. Reken op een aanzienlijk tragere verwerking en op verlies van vet en cursief op die pagina's.

Blijven tabellen echt behouden of worden ze slechts benaderd?

Zowel tabellen met lijnen als randloze indelingen met uitgelijnde kolommen worden herkend en herbouwd als Markdown-tabellen. Zeer complexe pagina's — samengevoegde cellen, geneste tabellen, zware visuele opmaak — vallen terug op gewone alinea's, en die pagina's staan in het resultaat vermeld zodat u weet welke u moet nakijken.

Wat gebeurt er met afbeeldingen in de PDF?

Standaard worden ze overgeslagen en krijgt u één .md-bestand. Vink «ingesloten afbeeldingen extraheren» aan en het resultaat is een ZIP met uw Markdown plus een map images/, waarbij de Markdown naar elk geëxtraheerd bestand verwijst.

Kan ik meerdere PDF's tegelijk converteren?

Ja, bij een abonnement met batchverwerking ingeschakeld. De bestanden komen als één taak in de wachtrij en worden teruggegeven als ZIP met een conversierapport. Zonder die abonnementsfunctie kunt u nog steeds onbeperkt bestanden converteren, één voor één.

Hoe gaat het om met wetenschappelijke artikelen in twee kolommen?

De kolomgrenzen worden bepaald voordat er tekst wordt gelezen, zodat elke kolom om de beurt van boven naar beneden wordt verwerkt. Zonder die stap wisselt de extractie regel voor regel tussen de kolommen en is de uitvoer onbruikbaar — precies waarom zoveel hulpmiddelen juist bij artikelen struikelen.

Kan ik een met een wachtwoord beveiligde PDF converteren?

Ja. Vergrendelde bestanden tonen een wachtwoordveld op hun eigen kaart, en het wachtwoord wordt in uw browser gecontroleerd voordat er iets wordt geüpload, dus een verkeerd wachtwoord valt meteen op. In een batch kan elk bestand een ander wachtwoord hebben.

Hoe groot mag een bestand zijn?

Dat hangt af van uw abonnement. De limiet die onder het uploadvak staat, is uw huidige limiet en wordt live uit uw account gelezen in plaats van een vast getal te zijn, dus opwaarderen verhoogt hem meteen.

Is de Markdown zo klaar om te publiceren?

Meestal zit u er dichtbij. Koppen, lijsten, tabellen en links komen er schoon uit, en de uitvoer is standaard CommonMark dat wordt weergegeven op GitHub, in wiki's en in statische sitegeneratoren. Documenten met een ongebruikelijke opmaak verdienen een snelle blik, en de melding bij het resultaat vertelt waar u moet kijken.

Hoe lang worden mijn bestanden bewaard?

Uploads en resultaten worden automatisch verwijderd na de bewaartermijn van uw abonnement, die onder het uploadvak wordt getoond. U kunt een geconverteerd bestand ook meteen verwijderen vanaf het downloadscherm.

Heb ik een account nodig?

Nee. Converteren werkt zonder aanmelden, binnen de limieten van het anonieme abonnement voor bestandsgrootte, pagina's en dagelijkse conversies. Aanmelden verhoogt die limieten en bewaart uw bestanden langer.

Gerelateerde hulpmiddelen

Andere manieren om inhoud uit een PDF te halen of erin te zetten.

Related Guides

Common document management mistakes small business make
General

Common document management mistakes small business make

Discover the most common document management mistakes small businesses make and learn simple ways to organize, store, share, and manage important files efficiently." focus_keyword: Document Management Mistakes

31 aug 20265 min read
The Difference Between Storing Documents and Actually Managing Them
General

The Difference Between Storing Documents and Actually Managing Them

Learn the difference between storing documents and actually managing them. Discover how better organization, version control, PDF tools, and workflows save time." focus_keyword: Document Storage vs Document Management

31 aug 20265 min read
PDF Techno vs iLovePDF OCR: Which Is More Accurate?
General

PDF Techno vs iLovePDF OCR: Which Is More Accurate?

Compare PDF Techno vs iLovePDF OCR for text accuracy, scanned PDFs, multilingual documents, tables, ease of use, and overall OCR performance.

31 aug 20265 min read
PDF Techno vs Smallpdf PDF to JPG: Which Is Better?
General

PDF Techno vs Smallpdf PDF to JPG: Which Is Better?

Compare PDF Techno vs Smallpdf PDF to JPG conversion for image quality, text clarity, scanned documents, file size, ease of use, and overall results.

26 aug 20265 min read
Edit PDF vs Repair PDF: What's the Difference and Which One Do You Need?
General

Edit PDF vs Repair PDF: What's the Difference and Which One Do You Need?

Confused between editing a PDF and repairing one? Learn the difference, when to use each option, and how PDF Techno helps you edit and repair PDF files quickly.

15 jul 20265 min read
PDF Security Checklist: 10 Things You Should Do Before Sharing a File
General

PDF Security Checklist: 10 Things You Should Do Before Sharing a File

Protect your sensitive documents with this PDF security checklist. Learn 10 essential steps to secure your PDF before sharing it online using PDF Techno.

15 jul 20265 min read