Chuyển đổi PDF sang Markdown

Biến mọi tệp PDF thành Markdown gọn gàng, có cấu trúc: tiêu đề, bảng, danh sách và liên kết đều được giữ lại.

Giữ nguyên bảng và tiêu đề
Chuyển đổi hàng loạt
An toàn và riêng tư

Thả Tệp PDF Vào Đây

Thả ra để thêm tệp

Một bộ phân tích PDF, không phải bản đổ chữ

Phần lớn công cụ «PDF sang văn bản» trả về một bức tường các dòng theo đúng thứ tự mà tệp tình cờ lưu chúng. Công cụ này dựng lại tài liệu: những dòng nào từng là tiêu đề, khối nào là bảng, cột nào đọc trước, và chỗ nào một ngắt trang đã cắt đôi đoạn văn.

Trích xuất văn bản thuần

Kết quả theo quý
Doanh thu tăng 18 % so với
cùng kỳ. Bảng bên dưới
Khu vực Q3 Q4
EMEA 4,1 4,8
APAC 2,7 3,9
phân tích kết quả theo từng
khu vực.

Bộ chuyển đổi này

## Kết quả theo quý

Doanh thu tăng 18 % so với cùng kỳ.
Bảng bên dưới phân tích kết quả
theo từng khu vực.

| Khu vực | Q3  | Q4  |
|---------|-----|-----|
| EMEA    | 4,1 | 4,8 |
| APAC    | 2,7 | 3,9 |

Cùng một tệp PDF. Khác biệt nằm ở cấu trúc: một cấp tiêu đề, một bảng thực thụ, và một đoạn văn được ghép lại quanh khối đã chen ngang nó.

Những gì sống sót qua quá trình chuyển đổi

Cấu trúc được suy ra từ hình học bố cục, chứ không đoán từ dấu câu.

Tiêu đề và danh sách

Cấp tiêu đề đến từ kích thước và độ đậm tương đối của phông chữ, nhờ vậy H2 vẫn là H2 thay vì trở thành một đoạn văn khác. Danh sách đánh số và không đánh số giữ nguyên cấp lồng nhau, còn các đoạn chữ đậm, nghiêng và đơn cách được chuyển thành nhấn mạnh cùng mã trong dòng của Markdown.

Bảng, có kẻ hay không kẻ

Bảng có viền được nhận ra nhờ các đường kẻ. Bảng không viền — thực chất chỉ là những cột văn bản thẳng hàng — được tìm ra bằng cách gom nhóm vị trí các ô, và đây chính là chỗ phần lớn công cụ chuyển đổi bó tay rồi cho ra một mớ mảnh vụn ngăn cách bằng dấu tab.

Thứ tự đọc nhiều cột

Một trang hai cột lưu văn bản trong một dòng chảy duy nhất đi zíc zắc giữa các cột. Đọc một cách ngây thơ thì cứ một dòng lại có một dòng đến từ chỗ sai. Ranh giới cột được xác định trước, nhờ vậy mỗi cột được đọc từ trên xuống dưới trước khi cột kế tiếp bắt đầu.

Liên kết và vá lại chỗ ngắt trang

Chú thích siêu liên kết trở thành liên kết Markdown thực thụ thay vì bị san phẳng thành văn bản trơ. Những đoạn văn bị ranh giới trang cắt đôi — với đầu trang, chân trang và số trang chen vào giữa — được khâu lại thành một đoạn duy nhất.

Chuyển đổi hàng loạt

Gửi cả một thư mục PDF như một tác vụ và nhận về tệp ZIP chứa từng tệp .md cùng bản kê CONVERSION_REPORT.md ghi lại điều đã xảy ra với mỗi tệp. Có sẵn trên các gói đã bật xử lý hàng loạt.

Riêng tư theo mặc định

Tệp được tải lên qua TLS, xử lý rồi tự động xóa khi hết thời gian lưu trữ của gói bạn dùng. Bản xem trước trang được tạo ngay trong trình duyệt, nên tệp PDF mà bạn quyết định không chuyển đổi sẽ không bao giờ rời khỏi máy bạn.

Bốn thứ khiến các bộ chuyển đổi PDF gãy

Tệp PDF lưu các chữ hình tại những tọa độ. Nó không lưu đoạn văn, bảng hay thứ tự đọc — tất cả đều phải suy luận ra. Đây là những gì việc suy luận đó phải vượt qua.

Bố cục hai cột

Vấn đề

Bài báo học thuật, bản tin và báo cáo thường niên dàn chữ theo cột, nhưng dòng nội dung bên dưới thường chạy thẳng ngang trang. Nếu trích xuất theo thứ tự lưu trữ, bạn sẽ nhận được dòng một của cột A, rồi dòng một của cột B, rồi dòng hai của cột A — một mớ đan xen đọc lên như vô nghĩa. Bộ phân tích trước hết nhận diện khe dọc giữa hai cột rồi đọc từng cột như một khối riêng.

Bảng không kẻ

Vấn đề

Rất nhiều bảng chẳng có đường kẻ nào; người đọc hiểu đó là bảng đơn thuần vì các giá trị thẳng hàng. Không có đường kẻ để nhận diện, tín hiệu duy nhất là phân tích hình học về chỗ văn bản bắt đầu và kết thúc trên mỗi dòng. Hàng và cột được suy ra từ những căn chỉnh ấy rồi dựng lại thành bảng Markdown.

Đoạn văn bị ngắt trang cắt đôi

Vấn đề

Một câu bắt đầu ở cuối trang 4 và kết thúc ở đầu trang 5 có đầu trang chạy, chân trang và số trang nằm chen giữa hai nửa của nó. Những phần lặp lại đó được nhận diện xuyên suốt các trang rồi loại bỏ, và hai mảnh được nối lại thành một đoạn văn.

Trang hoàn toàn không có chữ

Vấn đề

Một trang đã quét chứa hình ảnh chứ không phải ký tự — đúng nghĩa là chẳng có gì để trích xuất. Thay vì lặng lẽ cho ra một mục trống, những trang như vậy được đếm và báo lại kèm số trang, nhờ đó một kết quả ngắn được giải thích thay vì trông như lỗi. Bật OCR và chúng sẽ được đọc.

Trang đã quét: mặc định được báo, đọc được khi bạn yêu cầu

Nếu một trang không có lớp văn bản, bộ chuyển đổi sẽ cho bạn biết những trang nào bị ảnh hưởng thay vì lặng lẽ tạo ra một tệp ngắn hơn. OCR tùy chọn sẽ đọc những trang đó thành văn bản — mặc định tắt, vì đây là một sự đánh đổi thực sự chứ không phải nâng cấp miễn phí.

Nó lấy lại được gì

Tiêu đề, danh sách, bảng và thứ tự đọc đều trở lại, bởi tất cả được suy ra từ vị trí của các từ trên trang chứ không từ siêu dữ liệu phông chữ.

Cái giá phải trả

Khoảng 1,5 giây mỗi trang so với chừng 50 mili giây nếu không dùng — chậm hơn khoảng ba mươi lần — và bị giới hạn ở 50 trang mỗi tài liệu.

Thứ không thể khôi phục

Chữ đậm và chữ nghiêng. Kết quả OCR không mang theo thông tin phông chữ, nên phần nhấn mạnh trên các trang được nhận dạng mất hẳn. Lỗi nhận dạng trên bản quét kém chất lượng cũng là chuyện bình thường.

OCR dùng chung quyền theo gói với công cụ OCR độc lập. Những trang được đọc theo cách này được liệt kê riêng trong kết quả, để bạn biết chính xác phần nào của tài liệu cần kiểm tra lại.

Chuyển đổi nhiều tệp cùng lúc

Chế độ hàng loạt được xây dựng trên giả định rằng trong bất kỳ thư mục PDF thực tế nào cũng sẽ có ít nhất một tệp khó chiều.

1

Một tác vụ, một tệp ZIP

Mỗi tệp PDF trở thành một tệp .md riêng bên trong một kho lưu trữ duy nhất, nên việc di chuyển tài liệu chỉ là một lần tải lên và một lần tải về thay vì một vòng lặp lặp đi lặp lại.

2

Một tệp hỏng không bao giờ nhấn chìm cả mẻ

Một tệp PDF hỏng hoặc bị khóa sẽ thất bại một mình. Số còn lại vẫn chuyển đổi bình thường và vẫn tải về được — bạn không bao giờ phải quay lại từ đầu chỉ vì một tệp.

3

Bản ghi những gì đã xảy ra

Tệp CONVERSION_REPORT.md trong ZIP ghi lại kết quả của từng tệp nguồn: số trang đã chuyển đổi, những trang là bản quét, và những trang không xử lý được.

4

Mỗi tệp một mật khẩu

Các tệp PDF được bảo vệ hiếm khi dùng chung mật khẩu. Mỗi tệp bị khóa có ô nhập riêng, được kiểm tra ngay trong trình duyệt trước khi tải lên, nên gõ sai sẽ lộ ra ngay lập tức thay vì sau một lần truyền dài.

Markdown, văn bản thuần hay Word?

Cả ba đều lấy chữ ra khỏi tệp PDF. Chúng khác nhau ở chỗ giữ lại được bao nhiêu hình hài của tài liệu, và ở việc bạn có thể làm gì tiếp theo.

MarkdownVăn bản thuần (.txt)Word (.docx)
Tiêu đềGiữ dưới dạng cấp #MấtGiữ dưới dạng kiểu
BảngBảng MarkdownMấtGiữ nguyên
Dễ đọc khi so sánh thay đổiKhông — định dạng nhị phân
Hiển thị trên GitHub, wiki, trang tài liệuSẵn cóDưới dạng khối mãKhông, nếu chưa chuyển đổi
Đầu vào tốt cho mô hình ngôn ngữ hoặc chỉ mục tìm kiếmTốt nhất — cấu trúc còn nguyênDùng được, mất cấu trúcPhải trích xuất trước
Sửa được bằng mọi trình soạn thảo văn bảnKhông

Nguyên tắc chung: chọn Markdown khi văn bản sẽ được đọc, quản lý phiên bản hoặc xử lý tiếp; chọn Word khi sẽ dàn trang lại và in ra.

Cách chuyển PDF sang Markdown

Không cần tài khoản để dùng thử và không phải cài phần mềm nào.

1

Thêm tệp PDF của bạn

Kéo tệp vào bất kỳ đâu trên trang hoặc dùng hộp chọn tệp. Mỗi tệp sẽ có ảnh thu nhỏ trang đầu và số trang, được tạo ngay trong trình duyệt của bạn.

2

Đặt tùy chọn

Nếu muốn, hãy trích xuất hình ảnh nhúng, bật OCR cho các trang đã quét và nhập mật khẩu cho mọi tệp hiện đang bị khóa.

3

Chuyển đổi

Một tệp sẽ được chuyển đổi ngay. Nhiều tệp sẽ được xếp hàng thành một mẻ và xử lý cùng nhau, tiến độ hiện lên mỗi khi một tệp hoàn tất.

4

Tải về và đọc ghi chú

Bạn nhận được tệp .md, hoặc tệp ZIP nếu có trích xuất hình ảnh hay chuyển đổi nhiều tệp. Hãy đọc thông báo nếu nó xuất hiện: nó cho biết những trang nào cần được để mắt tới.

Nơi công cụ này thực sự được dùng

Bất cứ nơi nào một tệp PDF phải trở thành văn bản mà máy móc hoặc hệ quản lý phiên bản xử lý được.

Di chuyển tài liệu

Các sổ tay cũ, quy trình vận hành và bảng thông số bị nhốt trong PDF chuyển sang trang tài liệu, wiki hoặc kho mã với tiêu đề và bảng còn nguyên vẹn — không phải gõ lại, không cần một vòng định dạng lại.

Đường ống RAG và ngữ cảnh cho mô hình ngôn ngữ

Chất lượng truy hồi phụ thuộc rất nhiều vào việc chia đoạn, mà chia đoạn lại phụ thuộc vào cấu trúc. Tiêu đề Markdown cho bộ chia những ranh giới thực sự để cắt, điều mà văn bản thuần đơn giản là không có.

Nghiên cứu và ghi chú

Đưa các bài báo vào Obsidian, Notion hay Logseq với phần mục và bảng còn nguyên, nhờ đó trích dẫn và hình vẽ vẫn gắn với đúng tiêu đề mà chúng thuộc về.

Tài liệu có quản lý phiên bản

Markdown so sánh được theo từng dòng trong git. Một hợp đồng hay chính sách đã chuyển đổi một lần sau đó có thể được theo dõi, rà soát và phê duyệt theo đúng quy trình như mã nguồn.

Nội dung cho trang tĩnh và CMS

Markdown là đầu vào gốc của Hugo, Jekyll, Astro, Docusaurus và hầu hết CMS headless, nên tệp sau khi chuyển đổi rơi thẳng vào thư mục nội dung.

Trích xuất dữ liệu từ báo cáo

Báo cáo tài chính và báo cáo khảo sát chôn các con số trong bảng. Bảng Markdown phân tích cú pháp cực kỳ dễ, nhờ đó những con số ấy trở nên trong tầm với của một tập lệnh.

Những gì công cụ này không làm

Nên biết trước, vì một bộ chuyển đổi giấu đi điểm yếu của mình thì khó tin cậy hơn một bộ dám gọi tên chúng.

Trang khó được báo ra, không bị giấu đi

Những trang là bản quét, trang không xử lý được và trang quá phức tạp cho việc nhận diện bảng đều được báo kèm số trang trong kết quả. Trang phức tạp vẫn cho ra văn bản dưới dạng đoạn văn — thứ bị mất là hình hài của bảng.

Giới hạn dung lượng và số trang đến từ gói của bạn

Dung lượng tệp tối đa, số trang mỗi tài liệu và số tệp mỗi mẻ đều do gói của bạn quy định và hiển thị ở bảng bên cạnh khu vực tải lên. Con số hiện ra luôn là con số hiện tại của bạn.

Tệp được mã hóa cần mật khẩu của nó

Một tệp PDF bị khóa không thể đọc được nếu thiếu mật khẩu. Mật khẩu chỉ dùng cho đúng lần chuyển đổi đó, được kiểm tra trước trong trình duyệt và không bao giờ được lưu lại.

Câu hỏi thường gặp

Công cụ có dùng được với PDF đã quét không?

Không, nếu thiếu OCR, vì một trang đã quét chứa hình ảnh chứ không phải ký tự — chẳng có gì để trích xuất. Bộ chuyển đổi cho biết chính xác những trang nào là bản quét, và khi bật OCR thì chúng sẽ được đọc. Hãy chuẩn bị tinh thần là chậm hơn đáng kể và mất chữ đậm, chữ nghiêng trên những trang đó.

Bảng có thực sự được giữ nguyên hay chỉ gần đúng?

Cả bảng có đường kẻ lẫn bố cục cột thẳng hàng không viền đều được nhận diện và dựng lại thành bảng Markdown. Những trang rất phức tạp — ô gộp, bảng lồng nhau, trình bày nặng về hình thức — sẽ lùi về đoạn văn thường, và các trang đó được liệt kê trong kết quả để bạn biết cần kiểm tra trang nào.

Hình ảnh bên trong tệp PDF thì sao?

Mặc định chúng bị bỏ qua và bạn nhận một tệp .md duy nhất. Hãy tích chọn «trích xuất hình ảnh nhúng» và kết quả sẽ là tệp ZIP chứa Markdown của bạn cùng thư mục images/, trong đó Markdown liên kết tới từng tệp đã trích xuất.

Tôi có thể chuyển đổi nhiều tệp PDF cùng lúc không?

Có, trên gói đã bật xử lý hàng loạt. Các tệp được xếp hàng thành một tác vụ và trả về trong một tệp ZIP kèm báo cáo chuyển đổi. Nếu gói không có tính năng đó, bạn vẫn có thể chuyển đổi bao nhiêu tệp tùy ý, từng tệp một.

Công cụ xử lý bài báo học thuật hai cột thế nào?

Ranh giới cột được xác định trước khi đọc bất kỳ chữ nào, nhờ đó mỗi cột được xử lý lần lượt từ trên xuống dưới. Thiếu bước ấy, việc trích xuất sẽ nhảy qua lại giữa các cột theo từng dòng và kết quả không dùng được — đó chính là lý do rất nhiều công cụ vấp ngã đúng ở các bài báo.

Tôi có thể chuyển đổi tệp PDF được bảo vệ bằng mật khẩu không?

Có. Tệp bị khóa hiển thị ô nhập mật khẩu ngay trên thẻ của nó, và mật khẩu được xác minh trong trình duyệt trước khi bất cứ thứ gì được tải lên, nên nhập sai sẽ lộ ra tức thì. Trong một mẻ, mỗi tệp có thể có mật khẩu khác nhau.

Tệp lớn đến đâu thì chuyển đổi được?

Điều đó tùy vào gói của bạn. Giới hạn hiển thị bên dưới khu vực tải lên chính là giới hạn hiện tại của bạn, được đọc trực tiếp từ tài khoản chứ không phải một con số cố định, nên nâng cấp sẽ nâng nó lên ngay.

Markdown có thể đăng ngay mà không cần sửa không?

Thường là gần như vậy. Tiêu đề, danh sách, bảng và liên kết ra sạch sẽ, và kết quả là CommonMark chuẩn, hiển thị được trên GitHub, trong wiki và ở các trình dựng trang tĩnh. Tài liệu có bố cục khác thường thì nên đọc lướt qua một lượt, và thông báo ở phần kết quả sẽ chỉ cho bạn chỗ cần xem.

Tệp của tôi được lưu trong bao lâu?

Tệp tải lên và kết quả sẽ tự động bị xóa sau thời gian lưu trữ của gói bạn dùng, hiển thị ngay dưới khu vực tải lên. Bạn cũng có thể xóa ngay tệp đã chuyển đổi từ màn hình tải về.

Tôi có cần tài khoản không?

Không. Việc chuyển đổi hoạt động mà không cần đăng nhập, trong giới hạn của gói ẩn danh về dung lượng tệp, số trang và số lần chuyển đổi mỗi ngày. Đăng nhập sẽ nâng các giới hạn đó lên và giữ tệp của bạn lâu hơn.

Công cụ liên quan

Những cách khác để lấy nội dung ra khỏi tệp PDF, hoặc đưa nội dung vào.

Related Guides

Common document management mistakes small business make
General

Common document management mistakes small business make

Discover the most common document management mistakes small businesses make and learn simple ways to organize, store, share, and manage important files efficiently." focus_keyword: Document Management Mistakes

31 thg 8, 20265 min read
The Difference Between Storing Documents and Actually Managing Them
General

The Difference Between Storing Documents and Actually Managing Them

Learn the difference between storing documents and actually managing them. Discover how better organization, version control, PDF tools, and workflows save time." focus_keyword: Document Storage vs Document Management

31 thg 8, 20265 min read
PDF Techno vs iLovePDF OCR: Which Is More Accurate?
General

PDF Techno vs iLovePDF OCR: Which Is More Accurate?

Compare PDF Techno vs iLovePDF OCR for text accuracy, scanned PDFs, multilingual documents, tables, ease of use, and overall OCR performance.

31 thg 8, 20265 min read
PDF Techno vs Smallpdf PDF to JPG: Which Is Better?
General

PDF Techno vs Smallpdf PDF to JPG: Which Is Better?

Compare PDF Techno vs Smallpdf PDF to JPG conversion for image quality, text clarity, scanned documents, file size, ease of use, and overall results.

26 thg 8, 20265 min read
Edit PDF vs Repair PDF: What's the Difference and Which One Do You Need?
General

Edit PDF vs Repair PDF: What's the Difference and Which One Do You Need?

Confused between editing a PDF and repairing one? Learn the difference, when to use each option, and how PDF Techno helps you edit and repair PDF files quickly.

15 thg 7, 20265 min read
PDF Security Checklist: 10 Things You Should Do Before Sharing a File
General

PDF Security Checklist: 10 Things You Should Do Before Sharing a File

Protect your sensitive documents with this PDF security checklist. Learn 10 essential steps to secure your PDF before sharing it online using PDF Techno.

15 thg 7, 20265 min read