PDF dosyasını Markdown'a dönüştürün

Herhangi bir PDF'i temiz, yapılandırılmış Markdown'a dönüştürün: başlıklar, tablolar, listeler ve bağlantılar korunur.

Tablolar ve başlıklar korunur
Toplu dönüştürme
Güvenli ve gizli

PDF Dosyalarını Buraya Bırakın

Dosyaları eklemek için bırakın

Bir PDF çözümleyicisi, metin dökümü değil

«PDF'den metne» araçlarının çoğu, dosyanın satırları rastgele hangi sırayla sakladıysa o sırayla bir satır duvarı döndürür. Bu araç ise belgeyi yeniden kurar: hangi satırlar başlıktı, hangi blok tablodur, hangi sütun önce gelir ve bir sayfa sonu paragrafı nerede ikiye böldü.

Düz metin çıkarma

Çeyrek Sonuçları
Gelir yıllık bazda %18 arttı.
Aşağıdaki tablo performansı
Bölge Ç3 Ç4
EMEA 4,1 4,8
APAC 2,7 3,9
bölgelere göre ayrıntılı olarak
gösteriyor.

Bu dönüştürücü

## Çeyrek Sonuçları

Gelir yıllık bazda %18 arttı.
Aşağıdaki tablo performansı bölgelere
göre ayrıntılı gösteriyor.

| Bölge | Ç3  | Ç4  |
|-------|-----|-----|
| EMEA  | 4,1 | 4,8 |
| APAC  | 2,7 | 3,9 |

Aynı PDF. Fark yapıdadır: bir başlık düzeyi, gerçek bir tablo ve araya giren bloğun etrafında yeniden birleştirilmiş bir paragraf.

Dönüştürmeden sağ çıkanlar

Yapı, noktalama işaretlerinden tahmin edilmez; sayfa düzeninin geometrisinden çıkarılır.

Başlıklar ve listeler

Başlık düzeyleri, yazı tipinin göreli boyutu ve kalınlığından gelir; böylece bir H2 başka bir paragrafa dönüşmek yerine H2 olarak kalır. Sıralı ve sırasız listeler iç içe yapısını korur; kalın, italik ve eş aralıklı bölümler Markdown vurgusu ve satır içi kod olarak aktarılır.

Çizgili ya da çizgisiz tablolar

Kenarlıklı tablolar çizgilerinden saptanır. Kenarlıksız olanlar — aslında yalnızca hizalanmış metin sütunları — hücre konumları kümelenerek bulunur; çoğu dönüştürücünün pes edip sekmeyle ayrılmış parçalardan oluşan bir karmaşa ürettiği yer tam da burasıdır.

Çok sütunlu okuma sırası

İki sütunlu bir sayfa metnini, sütunlar arasında zikzak çizen tek bir akışta saklar. Saf biçimde okunduğunda her ikinci satır yanlış yerden gelir. Önce sütun sınırları saptanır, böylece her sütun bir sonraki başlamadan önce yukarıdan aşağıya okunur.

Bağlantılar ve sayfa sonu onarımı

Köprü açıklamaları, çıplak metne indirgenmek yerine gerçek Markdown bağlantılarına dönüşür. Sayfa sınırıyla bölünmüş paragraflar — araya sıkışmış üst bilgi, alt bilgi ve sayfa numarasıyla birlikte — tek bir paragraf hâlinde yeniden dikilir.

Toplu dönüştürme

Bir klasör dolusu PDF'i tek iş olarak gönderin; her .md dosyasını ve her birine ne olduğunu kaydeden CONVERSION_REPORT.md bildirimini içeren bir ZIP alın. Toplu işlemenin etkin olduğu planlarda kullanılabilir.

Varsayılan olarak gizli

Dosyalar TLS üzerinden yüklenir, işlenir ve planınızın saklama süresi dolduğunda otomatik olarak silinir. Sayfa önizlemeleri tarayıcınızda yerel olarak oluşturulur; dönüştürmemeye karar verdiğiniz bir PDF makinenizden hiç ayrılmaz.

PDF dönüştürücüleri bozan dört şey

Bir PDF, glifleri koordinatlarda saklar. Paragrafları, tabloları ya da okuma sırasını saklamaz; bunların hepsi çıkarsanmak zorundadır. İşte bu çıkarımın göğüslemesi gerekenler.

İki sütunlu düzenler

Sorun

Akademik makaleler, bültenler ve yıllık raporlar metni sütunlara yerleştirir, ama alttaki içerik akışı çoğu zaman sayfayı boydan boya kat eder. Saklanma sırasına göre çıkarırsanız A sütununun birinci satırını, ardından B sütununun birinci satırını, sonra A sütununun ikinci satırını elde edersiniz: anlamsız görünen, iç içe geçmiş bir karmaşa. Çözümleyici önce dikey boşluğu saptar ve her sütunu ayrı bir blok olarak okur.

Kenarlıksız tablolar

Sorun

Pek çok tabloda çizili hiçbir çizgi yoktur; insan onları tablo olarak yalnızca değerler hizalandığı için okur. Saptanacak çizgi olmayınca tek ipucu, metnin her satırda nerede başlayıp bittiğinin geometrik çözümlemesidir. Satırlar ve sütunlar bu hizalamalardan çıkarılır ve Markdown tabloları olarak yeniden kurulur.

Sayfa sonlarıyla kesilen paragraflar

Sorun

4. sayfanın altında başlayıp 5. sayfanın başında biten bir cümlenin iki yarısı arasında yinelenen bir üst bilgi, bir alt bilgi ve bir sayfa numarası bulunur. Bu yinelenen öğeler sayfalar boyunca belirlenip kaldırılır ve iki parça tek bir paragrafta birleştirilir.

Hiç metin içermeyen sayfalar

Sorun

Taranmış bir sayfa karakter değil görüntü içerir; çıkarılacak kelimenin tam anlamıyla hiçbir şey yoktur. Sessizce boş bir bölüm üretmek yerine bu sayfalar sayılır ve numaralarıyla bildirilir; böylece kısa bir çıktı hata gibi görünmek yerine açıklanmış olur. OCR'ı açarsanız bu sayfalar okunur.

Taranmış sayfalar: varsayılan olarak bildirilir, istenirse okunur

Bir sayfanın metin katmanı yoksa dönüştürücü, sessizce daha kısa bir dosya üretmek yerine hangi sayfaların etkilendiğini söyler. İsteğe bağlı OCR bu sayfaları metin olarak okur; varsayılan olarak kapalıdır, çünkü bedava bir iyileştirme değil gerçek bir ödünleşmedir.

Neyi geri kazandırır

Başlıklar, listeler, tablolar ve okuma sırası tümüyle geri gelir; çünkü bunlar yazı tipi meta verilerinden değil, kelimelerin sayfadaki konumundan türetilir.

Bedeli nedir

OCR'sız yaklaşık 50 milisaniyeye karşılık sayfa başına yaklaşık 1,5 saniye — kabaca otuz kat yavaş — ve belge başına 50 sayfayla sınırlı.

Geri getiremedikleri

Kalın ve italik. OCR çıktısı yazı tipi bilgisi taşımaz; bu yüzden tanınan sayfalardaki vurgu tümüyle kaybolur. Kötü taramalarda tanıma hataları da olağandır.

OCR, bağımsız OCR aracının kullandığı plan yetkisinin aynısını kullanır. Bu şekilde okunan sayfalar sonuçta ayrıca listelenir; böylece belgenin hangi bölümlerini bir kez daha gözden geçirmeniz gerektiğini tam olarak bilirsiniz.

Aynı anda çok sayıda dosya dönüştürme

Toplu kip, gerçek hayattaki her PDF klasöründe en az bir dosyanın sorun çıkaracağı varsayımı üzerine kuruludur.

1

Tek iş, tek ZIP

Her PDF, tek bir arşivin içinde kendi .md dosyasına dönüşür; böylece bir belgelendirme taşıması, tekrar eden bir döngü yerine tek yükleme ve tek indirmedir.

2

Tek bozuk dosya toplu işi asla batırmaz

Bozuk ya da kilitli bir PDF kendi başına başarısız olur. Geri kalanlar normal biçimde dönüştürülür ve indirilebilir kalır; tek bir dosya yüzünden asla başa dönmezsiniz.

3

Olan bitenin kaydı

ZIP içindeki CONVERSION_REPORT.md, her kaynak dosyanın sonucunu kaydeder: dönüştürülen sayfalar, tarama olan sayfalar ve işlenemeyen sayfalar.

4

Dosya başına bir parola

Korumalı PDF'ler nadiren aynı parolayı paylaşır. Kilitli her dosyanın kendi alanı vardır ve parola yüklemeden önce tarayıcınızda denetlenir; böylece bir yazım hatası uzun bir aktarımdan sonra değil, anında ortaya çıkar.

Markdown mı, düz metin mi, Word mü?

Üçü de bir PDF'ten kelimeleri çıkarır. Farkları, belgenin biçiminden ne kadarının onlarla birlikte geldiği ve sonrasında ne yapabileceğinizdir.

MarkdownDüz metin (.txt)Word (.docx)
Başlıklar# düzeyleri olarak korunurKaybolurStil olarak korunur
TablolarMarkdown tablolarıKaybolurKorunur
Fark görünümünde okunaklıEvetEvetHayır — ikili biçim
GitHub'da, wiki'lerde, belge sitelerinde görüntülenirDoğrudanKod bloğu olarakDönüştürmeden olmaz
Bir dil modeli ya da arama dizini için girdiEn iyisi — yapı korunurKullanılabilir, yapı yokÖnce çıkarım gerekir
Herhangi bir metin düzenleyicide düzenlenebilirEvetEvetHayır

Pratik kural: metin okunacak, sürümlenecek ya da işlenecekse Markdown; yeniden sayfalanıp basılacaksa Word.

Bir PDF'i Markdown'a nasıl dönüştürürsünüz

Denemek için hesap gerekmez, kurulacak bir yazılım da yok.

1

PDF'lerinizi ekleyin

Dosyaları sayfanın herhangi bir yerine sürükleyin ya da seçiciyi kullanın. Her dosya, tarayıcınızda yerel olarak oluşturulan bir ilk sayfa küçük resmi ve sayfa sayısı alır.

2

Seçenekleri ayarlayın

İsterseniz gömülü görselleri çıkarın, taranmış sayfalar için OCR'ı açın ve kilitli görünen her dosya için parola girin.

3

Dönüştürün

Tek dosya anında dönüştürülür. Birden fazlası toplu iş olarak sıraya alınıp birlikte işlenir; her biri bittikçe ilerleme gösterilir.

4

İndirin ve notları okuyun

Bir .md dosyası alırsınız; görsel çıkarıldıysa ya da birden fazla dosya dönüştürdüyseniz bir ZIP alırsınız. Bir bildirim çıkarsa okuyun: hangi sayfaların dikkat gerektirdiğini söyler.

Bunun gerçekte kullanıldığı yerler

Bir PDF'in, bir makinenin ya da sürüm denetiminin işleyebileceği metne dönüşmesi gereken her yer.

Belgelendirme taşıma

PDF'e hapsolmuş eski kılavuzlar, iş talimatları ve teknik föyler, başlıkları ve tabloları bozulmadan bir belge sitesine, wiki'ye ya da depoya taşınır; yeniden yazmak ya da biçimlendirme turu gerekmez.

RAG hatları ve dil modeli bağlamı

Getirme kalitesi büyük ölçüde parçalamaya, parçalama ise yapıya bağlıdır. Markdown başlıkları bölücüye kesilecek gerçek sınırlar verir; düz metnin sunamadığı tam olarak budur.

Araştırma ve not tutma

Makaleleri bölümleri ve tabloları korunmuş hâlde Obsidian, Notion ya da Logseq'e aktarın; böylece alıntılar ve şekiller geldikleri başlığa bağlı kalır.

Sürüm denetimindeki belgeler

Markdown, git içinde satır satır karşılaştırılır. Bir kez dönüştürülen bir sözleşme ya da politika, sonrasında kodla aynı iş akışında izlenebilir, incelenebilir ve onaylanabilir.

Statik siteler ve içerik yönetim sistemleri için içerik

Markdown; Hugo, Jekyll, Astro, Docusaurus ve başsız içerik yönetim sistemlerinin çoğu için doğal girdidir, bu yüzden dönüştürülen dosyalar doğrudan bir içerik dizinine düşer.

Raporlardan veri çıkarma

Mali tablolar ve araştırma raporları sayılarını tabloların içine gömer. Markdown tabloları son derece kolay ayrıştırılır; bu da o rakamları bir betiğin erişimine açar.

Yapmayacağı şeyler

Baştan bilmekte fayda var: kusurlarını gizleyen bir dönüştürücüye, onları adıyla söyleyenden daha zor güvenilir.

Zor sayfalar gizlenmez, bildirilir

Tarama olan, işlenemeyen ya da tablo saptaması için fazla karmaşık çıkan sayfaların her biri sonuçta numarasıyla bildirilir. Karmaşık sayfalar metinlerini yine de paragraf olarak üretir; kaybolan şey tablo biçimidir.

Boyut ve sayfa sınırları planınızdan gelir

En büyük dosya boyutu, belge başına sayfa ve toplu iş başına dosya sayısı planınızca belirlenir ve yükleme alanının yanındaki panelde gösterilir. Görünen değer her zaman güncel olanıdır.

Şifrelenmiş dosyalar parolasını ister

Kilitli bir PDF parolası olmadan okunamaz. Parolalar yalnızca o tek dönüştürme için kullanılır, önce tarayıcınızda denetlenir ve asla saklanmaz.

Sık sorulan sorular

Taranmış PDF'lerde çalışır mı?

OCR olmadan çalışmaz; çünkü taranmış bir sayfa karakter yerine görüntü içerir, çıkarılacak bir şey yoktur. Dönüştürücü hangi sayfaların tarama olduğunu tam olarak söyler ve OCR'ı açtığınızda bu sayfalar okunur. Belirgin biçimde daha yavaş olmasını ve o sayfalarda kalın ile italiğin kaybolmasını bekleyin.

Tablolar gerçekten korunuyor mu, yoksa yaklaşık mı çıkarılıyor?

Hem çizgili tablolar hem de kenarlıksız hizalı sütun düzenleri saptanıp Markdown tabloları olarak yeniden kurulur. Çok karmaşık sayfalar — birleştirilmiş hücreler, iç içe tablolar, yoğun görsel biçimlendirme — düz paragraflara geri düşer ve bu sayfalar sonuçta listelenir; böylece hangilerini denetlemeniz gerektiğini bilirsiniz.

PDF içindeki görsellere ne olur?

Varsayılan olarak atlanır ve tek bir .md dosyası alırsınız. «Gömülü görselleri çıkar» seçeneğini işaretlerseniz sonuç, Markdown'ınızı ve bir images/ klasörünü içeren bir ZIP olur; Markdown çıkarılan her dosyaya bağlantı verir.

Aynı anda birden fazla PDF dönüştürebilir miyim?

Evet, toplu işlemenin etkin olduğu bir planda. Dosyalar tek iş olarak sıraya alınır ve bir dönüştürme raporuyla birlikte ZIP olarak döner. Bu plan özelliği olmadan da dilediğiniz sayıda dosyayı teker teker dönüştürebilirsiniz.

İki sütunlu akademik makaleleri nasıl ele alıyor?

Sütun sınırları herhangi bir metin okunmadan önce saptanır; böylece her sütun sırayla yukarıdan aşağıya işlenir. Bu adım olmadan çıkarım satır satır sütunlar arasında gidip gelir ve çıktı kullanılamaz olur; bu kadar çok aracın özellikle makalelerde tökezlemesinin nedeni tam olarak budur.

Parola korumalı bir PDF'i dönüştürebilir miyim?

Evet. Kilitli dosyalar kendi kartlarında bir parola alanı gösterir ve parola, herhangi bir şey yüklenmeden önce tarayıcınızda doğrulanır; yanlış bir parola anında belli olur. Toplu işte her dosyanın parolası farklı olabilir.

Ne kadar büyük bir dosya dönüştürebilirim?

Bu, planınıza bağlıdır. Yükleme alanının altında görünen sınır sizin güncel sınırınızdır ve sabit bir sayı olmak yerine hesabınızdan canlı okunur; dolayısıyla yükseltme onu anında artırır.

Markdown olduğu gibi yayımlanmaya hazır mı?

Genellikle buna yakın. Başlıklar, listeler, tablolar ve bağlantılar temiz çıkar; sonuç, GitHub'da, wiki'lerde ve statik site üreticilerinde görüntülenen standart CommonMark'tır. Alışılmadık sayfa düzeni olan belgeleri hızlıca gözden geçirmekte fayda var; sonuçtaki bildirim nereye bakacağınızı söyler.

Dosyalarım ne kadar süre saklanıyor?

Yüklemeler ve dönüştürülmüş çıktılar, yükleme alanının altında gösterilen plan saklama sürenizin ardından otomatik olarak silinir. Dönüştürülmüş bir dosyayı indirme ekranından hemen de silebilirsiniz.

Hesap gerekiyor mu?

Hayır. Dönüştürme, anonim planın dosya boyutu, sayfa ve günlük dönüştürme sınırları içinde oturum açmadan çalışır. Oturum açmak bu sınırları yükseltir ve dosyalarınızı daha uzun süre saklamanızı sağlar.

İlgili araçlar

Bir PDF'ten içerik çıkarmanın ya da içine içerik koymanın diğer yolları.

Related Guides

Common document management mistakes small business make
General

Common document management mistakes small business make

Discover the most common document management mistakes small businesses make and learn simple ways to organize, store, share, and manage important files efficiently." focus_keyword: Document Management Mistakes

31 Ağu 20265 min read
The Difference Between Storing Documents and Actually Managing Them
General

The Difference Between Storing Documents and Actually Managing Them

Learn the difference between storing documents and actually managing them. Discover how better organization, version control, PDF tools, and workflows save time." focus_keyword: Document Storage vs Document Management

31 Ağu 20265 min read
PDF Techno vs iLovePDF OCR: Which Is More Accurate?
General

PDF Techno vs iLovePDF OCR: Which Is More Accurate?

Compare PDF Techno vs iLovePDF OCR for text accuracy, scanned PDFs, multilingual documents, tables, ease of use, and overall OCR performance.

31 Ağu 20265 min read
PDF Techno vs Smallpdf PDF to JPG: Which Is Better?
General

PDF Techno vs Smallpdf PDF to JPG: Which Is Better?

Compare PDF Techno vs Smallpdf PDF to JPG conversion for image quality, text clarity, scanned documents, file size, ease of use, and overall results.

26 Ağu 20265 min read
Edit PDF vs Repair PDF: What's the Difference and Which One Do You Need?
General

Edit PDF vs Repair PDF: What's the Difference and Which One Do You Need?

Confused between editing a PDF and repairing one? Learn the difference, when to use each option, and how PDF Techno helps you edit and repair PDF files quickly.

15 Tem 20265 min read
PDF Security Checklist: 10 Things You Should Do Before Sharing a File
General

PDF Security Checklist: 10 Things You Should Do Before Sharing a File

Protect your sensitive documents with this PDF security checklist. Learn 10 essential steps to secure your PDF before sharing it online using PDF Techno.

15 Tem 20265 min read