Конвертировать PDF в Markdown
Превратите любой PDF в чистый структурированный Markdown: заголовки, таблицы, списки и ссылки сохраняются.
Перетащите PDF-файлы сюда
Отпустите, чтобы добавить файлы
Разбор PDF, а не выгрузка текста
Большинство инструментов «PDF в текст» возвращают стену строк в том порядке, в котором файл случайно их сохранил. Этот же восстанавливает документ: какие строки были заголовком, какой блок был таблицей, какая колонка идёт первой и в каком месте разрыв страницы разрезал абзац пополам.
Извлечение простого текста
Квартальные результаты Выручка выросла на 18 % в годовом выражении. Таблица Регион К3 К4 EMEA 4,1 4,8 APAC 2,7 3,9 ниже показывает результаты по регионам.
Этот конвертер
## Квартальные результаты Выручка выросла на 18 % в годовом выражении. Таблица ниже показывает результаты по регионам. | Регион | К3 | К4 | |--------|-----|-----| | EMEA | 4,1 | 4,8 | | APAC | 2,7 | 3,9 |
Тот же самый PDF. Разница — в структуре: уровень заголовка, настоящая таблица и абзац, собранный обратно вокруг блока, который его прерывал.
Что переживает конвертацию
Структура выводится из геометрии вёрстки, а не угадывается по знакам препинания.
Заголовки и списки
Уровни заголовков определяются относительным размером и насыщенностью шрифта, поэтому H2 остаётся H2, а не превращается в очередной абзац. Нумерованные и маркированные списки сохраняют вложенность, а фрагменты полужирного, курсивного и моноширинного начертания переносятся как выделение и код внутри строки в Markdown.
Таблицы с линиями и без
Таблицы с рамками распознаются по их линиям. Таблицы без рамок — по сути просто выровненные колонки текста — находятся кластеризацией положений ячеек, и именно здесь большинство конвертеров сдаётся и выдаёт мешанину фрагментов, разделённых табуляцией.
Порядок чтения в несколько колонок
Двухколоночная страница хранит текст в одном потоке, который зигзагом переходит между колонками. При наивном чтении каждая вторая строка приходит не оттуда. Границы колонок определяются в первую очередь, поэтому каждая колонка читается сверху вниз до начала следующей.
Ссылки и починка разрывов страниц
Аннотации гиперссылок становятся настоящими ссылками Markdown, а не схлопываются в голый текст. Абзацы, разрезанные границей страницы, — с колонтитулом, нижним колонтитулом и номером страницы, вклинившимися между половинками, — сшиваются обратно в один абзац.
Пакетная конвертация
Отправьте целую папку PDF одной задачей и получите архив ZIP с каждым файлом .md и сводкой CONVERSION_REPORT.md, где записано, что произошло с каждым из них. Доступно в тарифах с включённой пакетной обработкой.
Конфиденциально по умолчанию
Файлы загружаются по TLS, обрабатываются и автоматически удаляются по истечении срока хранения вашего тарифа. Предпросмотр страниц создаётся локально в браузере, поэтому PDF, который вы решили не конвертировать, никогда не покидает ваш компьютер.
Четыре вещи, на которых ломаются конвертеры PDF
PDF хранит глифы в координатах. Он не хранит абзацы, таблицы или порядок чтения — всё это приходится выводить. Вот что этому выводу приходится выдерживать.
Двухколоночная вёрстка
Проблема
Научные статьи, рассылки и годовые отчёты размещают текст в колонках, но лежащий в основе поток содержимого часто идёт поперёк всей страницы. Если извлекать его в порядке хранения, получится первая строка колонки A, затем первая строка колонки B, затем вторая строка колонки A — переплетённая мешанина, которая читается как бессмыслица. Анализатор сначала определяет вертикальный промежуток и читает каждую колонку как отдельный блок.
Таблицы без линий
Проблема
У множества таблиц вовсе нет нарисованных линий; человек читает их как таблицу лишь потому, что значения выровнены. Когда линий для распознавания нет, единственный признак — геометрический анализ того, где текст начинается и заканчивается в каждой строке. Строки и столбцы выводятся из этих выравниваний и восстанавливаются как таблицы Markdown.
Абзацы, разрезанные разрывом страницы
Проблема
У предложения, которое начинается внизу страницы 4 и заканчивается вверху страницы 5, между двумя половинами находятся колонтитул, нижний колонтитул и номер страницы. Эти повторяющиеся элементы распознаются по всем страницам и удаляются, а два фрагмента объединяются в один абзац.
Страницы вообще без текста
Проблема
Отсканированная страница содержит изображение, а не символы — извлекать буквально нечего. Вместо того чтобы молча выдать пустой раздел, такие страницы подсчитываются и возвращаются с номерами, поэтому короткий результат оказывается объяснённым, а не выглядит как сбой. Включите OCR — и они будут прочитаны.
Отсканированные страницы: по умолчанию отмечаются, по запросу читаются
Если у страницы нет текстового слоя, конвертер сообщит, какие страницы затронуты, вместо того чтобы молча выдать файл покороче. Необязательный OCR читает такие страницы как текст — по умолчанию он выключен, потому что это настоящий компромисс, а не бесплатное улучшение.
Что он возвращает
Заголовки, списки, таблицы и порядок чтения возвращаются целиком, потому что выводятся из расположения слов на странице, а не из метаданных шрифта.
Чего это стоит
Около 1,5 секунды на страницу против примерно 50 миллисекунд без него — примерно в тридцать раз медленнее — и с ограничением в 50 страниц на документ.
Что вернуть невозможно
Полужирный и курсив. Вывод OCR не несёт сведений о шрифте, поэтому выделение на распознанных страницах теряется безвозвратно. Ошибки распознавания на плохих сканах тоже нормальны.
OCR использует то же тарифное право, что и отдельный инструмент OCR. Прочитанные таким образом страницы перечисляются в результате отдельно, чтобы вы точно знали, какие части документа стоит перепроверить.
Конвертация множества файлов сразу
Пакетный режим исходит из того, что в любой реальной папке с PDF хотя бы один файл окажется неудобным.
Одна задача, один ZIP
Каждый PDF становится собственным файлом .md внутри одного архива, поэтому перенос документации — это одна загрузка и одно скачивание, а не однообразный цикл.
Один плохой файл никогда не топит пакет
Повреждённый или заблокированный PDF не проходит сам по себе. Остальные конвертируются как обычно и остаются доступными для скачивания — вы никогда не начинаете заново из-за одного файла.
Запись о том, что произошло
Файл CONVERSION_REPORT.md внутри архива фиксирует итог по каждому исходному файлу: сконвертированные страницы, страницы, оказавшиеся сканами, и страницы, которые не удалось обработать.
Свой пароль для каждого файла
У защищённых PDF редко бывает общий пароль. У каждого заблокированного файла своё поле, а пароль проверяется в браузере до загрузки, поэтому опечатка обнаруживается сразу, а не после долгой передачи.
Markdown, простой текст или Word?
Все три способа достают слова из PDF. Отличаются они тем, сколько формы документа переносится вместе с ними и что с этим можно делать дальше.
| Markdown | Простой текст (.txt) | Word (.docx) | |
|---|---|---|---|
| Заголовки | Сохранены как уровни # | Теряются | Сохранены как стили |
| Таблицы | Таблицы Markdown | Теряются | Сохраняются |
| Хорошо читается в сравнении изменений | Да | Да | Нет — двоичный формат |
| Отображается на GitHub, в вики и на сайтах документации | Штатно | Как блок кода | Не без конвертации |
| Хороший вход для языковой модели или поискового индекса | Лучший — структура сохраняется | Годится, структуры нет | Нужно сначала извлечь |
| Редактируется в любом текстовом редакторе | Да | Да | Нет |
Практическое правило: Markdown, когда текст будут читать, версионировать или обрабатывать дальше; Word, когда его будут заново вёрстывать и печатать.
Как конвертировать PDF в Markdown
Чтобы попробовать, не нужны ни учётная запись, ни установка программ.
Добавьте ваши PDF
Перетащите файлы в любое место страницы или воспользуйтесь выбором файлов. Каждый получает миниатюру первой страницы и число страниц, создаваемые локально в вашем браузере.
Задайте параметры
При желании извлеките встроенные изображения, включите OCR для отсканированных страниц и введите пароль для каждого файла, отмеченного как заблокированный.
Запустите конвертацию
Один файл конвертируется сразу. Несколько ставятся в очередь как пакет и обрабатываются вместе, а ход выполнения показывается по мере завершения каждого.
Скачайте и прочитайте примечания
Вы получите файл .md либо архив ZIP, если извлекались изображения или конвертировалось несколько файлов. Прочитайте уведомление, если оно появится: в нём указано, какие страницы потребовали внимания.
Где это действительно применяют
Везде, где PDF должен стать текстом, с которым сможет работать машина или система контроля версий.
Перенос документации
Старые руководства, регламенты и спецификации, запертые в PDF, переезжают на сайт документации, в вики или репозиторий с нетронутыми заголовками и таблицами — без перепечатывания и без отдельного круга переформатирования.
Конвейеры RAG и контекст для языковых моделей
Качество поиска сильно зависит от нарезки, а нарезка — от структуры. Заголовки Markdown дают разделителю настоящие границы для разреза, чего простой текст попросту не предлагает.
Исследования и заметки
Перенесите статьи в Obsidian, Notion или Logseq с сохранёнными разделами и таблицами, чтобы цитаты и иллюстрации оставались привязаны к заголовку, из которого пришли.
Документы под контролем версий
Markdown сравнивается построчно в git. Однажды сконвертированный договор или регламент можно затем отслеживать, рецензировать и утверждать по тому же процессу, что и код.
Контент для статических сайтов и CMS
Markdown — родной формат ввода для Hugo, Jekyll, Astro, Docusaurus и большинства headless-CMS, поэтому сконвертированные файлы ложатся прямо в каталог с контентом.
Извлечение данных из отчётов
Финансовая отчётность и исследовательские отчёты прячут цифры внутри таблиц. Таблицы Markdown разбираются элементарно, благодаря чему эти значения становятся доступны скрипту.
Чего инструмент не сделает
Стоит знать заранее: конвертеру, который прячет свои слабые места, доверять сложнее, чем тому, который их называет.
Трудные страницы отмечаются, а не скрываются
Страницы, оказавшиеся сканами, не поддавшиеся обработке или слишком сложные для распознавания таблиц, перечисляются в результате с номерами. Сложные страницы всё равно отдают свой текст абзацами — теряется именно форма таблицы.
Ограничения по размеру и страницам берутся из вашего тарифа
Максимальный размер файла, число страниц в документе и число файлов в пакете задаются вашим тарифом и показываются на панели рядом с областью загрузки. Отображаемое значение всегда актуально для вас.
Зашифрованным файлам нужен их пароль
Заблокированный PDF без него не прочитать. Пароли используются для одной этой конвертации, предварительно проверяются в вашем браузере и никогда не сохраняются.
Частые вопросы
Работает ли это с отсканированными PDF?
Без OCR — нет, потому что отсканированная страница содержит изображение, а не символы: извлекать нечего. Конвертер точно укажет, какие страницы были сканами, и при включённом OCR они будут прочитаны. Учтите, что работа заметно замедлится, а полужирный и курсив на этих страницах пропадут.
Таблицы действительно сохраняются или лишь приблизительно?
Распознаются и восстанавливаются как таблицы Markdown и таблицы с линиями, и безрамочные раскладки из выровненных колонок. Очень сложные страницы — объединённые ячейки, вложенные таблицы, тяжёлое визуальное оформление — откатываются к обычным абзацам, и такие страницы перечисляются в результате, чтобы вы знали, какие проверить.
Что происходит с изображениями внутри PDF?
По умолчанию они пропускаются, и вы получаете один файл .md. Отметьте «извлечь встроенные изображения» — и результатом станет архив ZIP с вашим Markdown и папкой images/, причём Markdown ссылается на каждый извлечённый файл.
Можно ли конвертировать несколько PDF сразу?
Да, на тарифе с включённой пакетной обработкой. Файлы ставятся в очередь одной задачей и возвращаются архивом ZIP с отчётом о конвертации. Без этой возможности тарифа вы всё равно можете конвертировать сколько угодно файлов по одному.
Как он справляется с двухколоночными научными статьями?
Границы колонок определяются до того, как будет прочитан хоть какой-то текст, поэтому каждая колонка обрабатывается сверху вниз по очереди. Без этого шага извлечение построчно скачет между колонками и результат непригоден — именно поэтому столько инструментов спотыкается как раз на статьях.
Можно ли конвертировать PDF, защищённый паролем?
Да. У заблокированных файлов на их собственной карточке есть поле для пароля, и пароль проверяется в браузере ещё до того, как что-либо будет загружено, поэтому неверный обнаруживается мгновенно. В пакете у каждого файла может быть свой пароль.
Файл какого размера можно конвертировать?
Это зависит от вашего тарифа. Ограничение, показанное под областью загрузки, — ваше текущее, и оно считывается из вашей учётной записи в реальном времени, а не задано жёстко, поэтому переход на более высокий тариф поднимает его сразу.
Готов ли Markdown к публикации как есть?
Обычно почти готов. Заголовки, списки, таблицы и ссылки выходят чистыми, а результат — стандартный CommonMark, который отображается на GitHub, в вики и в генераторах статических сайтов. Документы с необычной вёрсткой стоит бегло просмотреть, а уведомление в результате подскажет, куда смотреть.
Как долго хранятся мои файлы?
Загруженные файлы и результаты удаляются автоматически по истечении срока хранения вашего тарифа, указанного под областью загрузки. Сконвертированный файл можно также удалить сразу с экрана скачивания.
Нужна ли учётная запись?
Нет. Конвертация работает без входа в систему, в пределах ограничений анонимного тарифа по размеру файла, числу страниц и количеству конвертаций в сутки. Вход поднимает эти ограничения и продлевает срок хранения файлов.
Похожие инструменты
Другие способы извлечь содержимое из PDF или поместить его туда.
Related Guides

Common document management mistakes small business make
Discover the most common document management mistakes small businesses make and learn simple ways to organize, store, share, and manage important files efficiently." focus_keyword: Document Management Mistakes

The Difference Between Storing Documents and Actually Managing Them
Learn the difference between storing documents and actually managing them. Discover how better organization, version control, PDF tools, and workflows save time." focus_keyword: Document Storage vs Document Management

PDF Techno vs iLovePDF OCR: Which Is More Accurate?
Compare PDF Techno vs iLovePDF OCR for text accuracy, scanned PDFs, multilingual documents, tables, ease of use, and overall OCR performance.

PDF Techno vs Smallpdf PDF to JPG: Which Is Better?
Compare PDF Techno vs Smallpdf PDF to JPG conversion for image quality, text clarity, scanned documents, file size, ease of use, and overall results.

Edit PDF vs Repair PDF: What's the Difference and Which One Do You Need?
Confused between editing a PDF and repairing one? Learn the difference, when to use each option, and how PDF Techno helps you edit and repair PDF files quickly.

PDF Security Checklist: 10 Things You Should Do Before Sharing a File
Protect your sensitive documents with this PDF security checklist. Learn 10 essential steps to secure your PDF before sharing it online using PDF Techno.