把 PDF 轉換為 Markdown
把任何 PDF 轉成乾淨、有結構的 Markdown——標題、表格、清單與連結都會保留。
將 PDF 檔案拖曳至此
放開即可新增檔案
一個 PDF 剖析器,而不是一堆文字
多數「PDF 轉文字」工具,只會照著檔案碰巧儲存的順序丟回一整面文字牆。這個工具則會重建文件:哪些行原本是標題、哪一塊原本是表格、哪一欄該先讀,以及分頁在哪裡把一個段落攔腰截斷。
純文字擷取
季度業績 營收年增 18 %。 下表依地區 地區 第三季 第四季 EMEA 4.1 4.8 APAC 2.7 3.9 列出各自的表現。
本轉換器
## 季度業績 營收年增 18 %。下表依地區 列出各自的表現。 | 地區 | 第三季 | 第四季 | |-------|-------|-------| | EMEA | 4.1 | 4.8 | | APAC | 2.7 | 3.9 |
同一個 PDF。差別在於結構:一個標題層級、一張真正的表格,以及一個繞開中間插入區塊、重新接回原樣的段落。
轉換之後仍然留下的東西
結構取自版面的幾何關係,而不是靠標點去猜。
標題與清單
標題層級由字級與字重的相對關係推得,因此二級標題仍是二級標題,不會淪為又一個段落。有序與無序清單保留巢狀層次,粗體、斜體與等寬片段則作為 Markdown 的強調與行內程式碼一併帶過去。
有框線沒框線,都是表格
有框線的表格靠線條辨識。沒有框線的——其實只是對齊排列的文字欄——則透過將儲存格位置分群找出來,而這正是多數轉換器放棄、只吐出一堆用定位字元隔開的碎片的地方。
多欄閱讀順序
雙欄頁面把內文存成一條在兩欄之間來回穿梭的流。照直讀下去,每隔一行就有一行來自錯誤的位置。系統會先辨識欄與欄之間的分界,因此每一欄都從上讀到下,之後才開始下一欄。
連結與分頁修復
超連結註解會變成真正的 Markdown 連結,而不是被壓平成光禿禿的文字。被頁面邊界切開的段落——即使兩半之間夾著頁首、頁尾與頁碼——也會被重新縫合成一個段落。
批次轉換
把整整一個資料夾的 PDF 當作一個工作送過來,你會拿到一個 ZIP,裡面既有每個 .md 檔,也有記錄著每個檔案遭遇的 CONVERSION_REPORT.md 清單。已啟用批次處理的方案可以使用。
預設就是私密的
檔案透過 TLS 上傳、處理,並在你方案的保存期結束後自動刪除。頁面預覽是在你的瀏覽器裡產生的,因此你最後決定不轉換的 PDF 從未離開過你的裝置。
讓 PDF 轉換器垮掉的四件事
PDF 把字形存放在座標上。它不存段落、不存表格、也不存閱讀順序——這些都得靠推論。以下就是這份推論必須扛住的東西。
雙欄排版
問題所在
學術論文、電子報與年報都把內文排成欄,但底層的內容流往往橫穿整頁。若照儲存順序擷取,你會先拿到 A 欄第一行,再是 B 欄第一行,再是 A 欄第二行——一團交錯纏繞、讀起來不知所云的東西。剖析器會先辨識出中間那道直向空隙,再把每一欄當作獨立的區塊來讀。
沒有框線的表格
問題所在
許多表格根本沒有畫任何線;人之所以把它讀成表格,只因為數值是對齊的。既然沒有線可供辨識,唯一的線索就是對每一列中文字從哪裡開始、到哪裡結束做幾何分析。列與欄正是從這些對齊關係推論出來,並重建為 Markdown 表格。
被分頁截斷的段落
問題所在
一個從第 4 頁底部開始、到第 5 頁頂端結束的句子,兩半之間夾著連續頁首、頁尾與頁碼。這些反覆出現的元素會跨頁被辨識並剔除,兩個片段再合回同一個段落。
完全沒有文字的頁面
問題所在
掃描頁裡裝的是影像,不是字元——字面意義上沒有任何東西可以擷取。與其悄無聲息地輸出一段空白,不如把這些頁面數出來、連同頁碼一併告知;如此一來,偏短的結果就有了解釋,而不像是出了問題。開啟 OCR,這些頁面就會被讀取。
掃描頁:預設告知,需要時才讀取
如果某一頁沒有文字圖層,轉換器會告訴你受影響的是哪些頁,而不是不聲不響地做出一個較短的檔案。選用的 OCR 會把這些頁面當作文字讀取——預設關閉,因為這是一次實實在在的取捨,而不是白送的改進。
它能找回什麼
標題、清單、表格與閱讀順序都會回來,因為它們來自詞語在頁面上的位置,而不是字型的中繼資料。
代價是什麼
每頁約 1.5 秒,而不開啟時約為 50 毫秒——大約慢三十倍——而且每份文件上限為 50 頁。
它找不回什麼
粗體與斜體。OCR 的輸出不帶任何字型資訊,因此被辨識頁面上的強調徹底遺失。掃描品質不佳時出現辨識錯誤也很正常。
OCR 使用的方案權限,與獨立的 OCR 工具完全相同。以這種方式讀取的頁面會在結果裡另外列出,讓你清楚該複查文件的哪些部分。
一次轉換許多檔案
批次模式的前提假設是:任何一個真實的 PDF 資料夾裡,至少會有一個檔案不好對付。
一個工作,一個 ZIP
每個 PDF 在同一個壓縮檔裡各自成為一個 .md 檔,於是文件搬遷就是一次上傳加一次下載,而不是一遍遍的重複勞動。
一個壞檔案從不會拖垮整批
毀損或鎖定的 PDF 只會自己失敗。其餘檔案照常轉換,而且始終可以下載——你絕不會因為一個檔案而從頭再來。
一份關於發生了什麼的紀錄
ZIP 內的 CONVERSION_REPORT.md 會記錄每個來源檔案的結果:轉換了多少頁、哪些頁是掃描件、哪些頁無法處理。
每個檔案一組密碼
受保護的 PDF 很少共用同一組密碼。因此每個鎖定檔案都有自己的輸入欄,並在上傳之前就在你的瀏覽器裡驗證,打錯會立刻顯現,而不是等一次漫長的傳輸之後。
Markdown、純文字,還是 Word?
三者都能把文字從 PDF 裡取出來。差別在於文件的形貌能跟著帶走多少,以及之後你還能拿它做什麼。
| Markdown | 純文字(.txt) | Word(.docx) | |
|---|---|---|---|
| 標題 | 以 # 層級保留 | 遺失 | 以樣式保留 |
| 表格 | Markdown 表格 | 遺失 | 保留 |
| 在差異比對中易讀 | 是 | 是 | 否——二進位格式 |
| 在 GitHub、wiki、文件站上呈現 | 原生支援 | 作為程式碼區塊 | 不轉換就不行 |
| 作為大型語言模型或搜尋索引的輸入 | 最佳——結構得以保留 | 堪用,但沒有結構 | 需要先行擷取 |
| 可在任何文字編輯器中編輯 | 是 | 是 | 否 |
經驗法則:文字要被閱讀、納入版本管理或繼續加工,就用 Markdown;要重新排版付印,就用 Word。
如何把 PDF 轉換為 Markdown
試用不需要帳號,也沒有軟體要安裝。
加入你的 PDF
把檔案拖到本頁任何地方,或使用選擇按鈕。每個檔案都會附上首頁縮圖與頁數,兩者都在你的瀏覽器裡產生。
設定選項
需要的話可以取出內嵌圖片、為掃描頁開啟 OCR,並為每個顯示為鎖定的檔案輸入密碼。
開始轉換
單一檔案會立即轉換。多個檔案會當成一批排隊並一起處理,每完成一個就更新一次進度。
下載並閱讀說明
你會得到一個 .md 檔;若取出了圖片或轉換了多個檔案,則是一個 ZIP。若出現提示訊息,請讀一讀:它會說明哪些頁面需要留意。
它實際用在哪裡
任何需要把 PDF 變成機器或版本管理能處理的文字的場合。
文件搬遷
困在 PDF 裡的舊手冊、作業程序與規格表,可以帶著完整的標題與表格搬進文件站、wiki 或程式碼儲存庫——不用重打,也不用再走一遍排版整理。
RAG 流程與大型語言模型的脈絡
檢索品質在很大程度上取決於分塊,而分塊取決於結構。Markdown 的標題為切分器提供了真實可切的界線,這正是純文字給不了的。
研究與筆記
把論文匯入 Obsidian、Notion 或 Logseq,章節與表格都還在,引文與插圖因此始終與它們所屬的標題相連。
納入版本管理的文件
Markdown 在 git 裡可以逐行比對。一份轉換過一次的合約或規章,之後就能沿用與程式碼相同的流程去追蹤、審閱與核准。
靜態網站與 CMS 的內容
Markdown 是 Hugo、Jekyll、Astro、Docusaurus 以及多數無頭 CMS 的原生輸入,轉換後的檔案可以直接放進內容目錄。
從報告中擷取資料
財務報表與調查報告把數字埋在表格裡。Markdown 表格解析起來極其容易,這些數字於是落到了指令碼觸手可及的地方。
它做不到的事
值得事先知道:一個藏著自己短處的轉換器,比一個把短處說清楚的轉換器更難讓人信任。
難處理的頁面會被指出,而不是被隱藏
屬於掃描件的頁面、無法剖析的頁面,以及複雜到無法完成表格辨識的頁面,都會連同頁碼在結果裡逐一說明。複雜頁面仍會以段落形式輸出內文——失去的是表格的形貌。
大小與頁數上限來自你的方案
最大檔案容量、每份文件的頁數、每批的檔案數,統統由你的方案決定,並顯示在上傳區旁邊的面板裡。顯示的數值始終是你目前的數值。
加密檔案需要它自己的密碼
沒有密碼就讀不了鎖定的 PDF。密碼只用於那一次轉換,事先在你的瀏覽器裡驗證,而且絕不保存。
常見問題
掃描版的 PDF 能用嗎?
不開 OCR 就不行,因為掃描頁裡存的是影像而非字元,沒有東西可擷取。轉換器會準確告訴你哪些頁面是掃描件,開啟 OCR 後這些頁面就會被讀取。請預期處理會明顯變慢,而且那些頁面上的粗體與斜體會遺失。
表格是真的保留下來,還是只是近似?
有框線的表格,以及沒有框線、僅靠對齊形成的分欄版面,都會被辨識並重建為 Markdown 表格。極其複雜的頁面——合併儲存格、巢狀表格、繁重的視覺裝飾——會退回成一般段落,而這些頁面會在結果裡列出,方便你知道該檢查哪幾頁。
PDF 裡的圖片會怎樣?
預設會略過,你得到的是單一 .md 檔。勾選「取出內嵌圖片」,結果就是一個 ZIP,裡面有你的 Markdown 和一個 images/ 資料夾,Markdown 會連結到每個被取出的檔案。
可以一次轉換多個 PDF 嗎?
在已啟用批次處理的方案上可以。檔案會當作一個工作排隊,並連同一份轉換報告以 ZIP 回傳。即使方案沒有這項功能,你仍然可以不限數量地逐一轉換。
雙欄的學術論文是怎麼處理的?
在讀取任何文字之前先辨識欄的界線,因此每一欄都輪流從上處理到下。少了這一步,擷取就會逐行在兩欄之間來回跳,輸出根本沒法用——這正是那麼多工具偏偏栽在論文上的原因。
受密碼保護的 PDF 能轉換嗎?
可以。鎖定檔案會在自己的卡片上顯示密碼輸入欄,而且在任何內容上傳之前就先在你的瀏覽器裡驗證,密碼錯了會立刻顯現。在一批檔案裡,每個檔案可以有不同的密碼。
檔案最大能多大?
這取決於你的方案。上傳區下方顯示的上限就是你目前的上限,它不是寫死的數字,而是即時從你的帳戶讀取,因此升級方案後會立即提高。
輸出的 Markdown 可以直接發布嗎?
通常已經很接近了。標題、清單、表格與連結都輸出得很乾淨,結果是標準的 CommonMark,能在 GitHub、wiki 與靜態網站產生器裡正常呈現。版面不尋常的文件值得快速通讀一遍,而結果裡的提示會告訴你該看哪裡。
我的檔案會保存多久?
上傳的檔案與轉換結果會在你方案的保存期結束後自動刪除,保存期就顯示在上傳區下方。你也可以在下載頁面立刻刪除已轉換的檔案。
需要帳號嗎?
不需要。在匿名方案關於檔案容量、頁數與每日轉換次數的額度之內,不登入也能轉換。登入會提高這些額度,檔案也能保存更久。
Related Guides

Common document management mistakes small business make
Discover the most common document management mistakes small businesses make and learn simple ways to organize, store, share, and manage important files efficiently." focus_keyword: Document Management Mistakes

The Difference Between Storing Documents and Actually Managing Them
Learn the difference between storing documents and actually managing them. Discover how better organization, version control, PDF tools, and workflows save time." focus_keyword: Document Storage vs Document Management

PDF Techno vs iLovePDF OCR: Which Is More Accurate?
Compare PDF Techno vs iLovePDF OCR for text accuracy, scanned PDFs, multilingual documents, tables, ease of use, and overall OCR performance.

PDF Techno vs Smallpdf PDF to JPG: Which Is Better?
Compare PDF Techno vs Smallpdf PDF to JPG conversion for image quality, text clarity, scanned documents, file size, ease of use, and overall results.

Edit PDF vs Repair PDF: What's the Difference and Which One Do You Need?
Confused between editing a PDF and repairing one? Learn the difference, when to use each option, and how PDF Techno helps you edit and repair PDF files quickly.

PDF Security Checklist: 10 Things You Should Do Before Sharing a File
Protect your sensitive documents with this PDF security checklist. Learn 10 essential steps to secure your PDF before sharing it online using PDF Techno.