PDF Techno

PDF を Markdown に変換

どんな PDF も、見出し・表・リスト・リンクを保ったまま、整った構造の Markdown に変換します。

表と見出しを保持
一括変換
安全かつ非公開

PDFファイルをここにドロップ

離してファイルを追加

テキストの寄せ集めではなく、PDF の構文解析

「PDF をテキストに」する多くのツールは、ファイルがたまたま保存した順序のまま、行の壁を返してきます。このツールは文書そのものを組み立て直します。どの行が見出しだったのか、どの塊が表だったのか、どの段を先に読むのか、そして改ページが段落をどこで真っ二つにしたのかを。

素のテキスト抽出

四半期業績
売上高は前年同期比 18 %
増加しました。下の表は
地域 Q3 Q4
EMEA 4.1 4.8
APAC 2.7 3.9
地域別の業績を示して
います。

このコンバーター

## 四半期業績

売上高は前年同期比 18 % 増加しました。
下の表は地域別の業績を示しています。

| 地域  | Q3  | Q4  |
|-------|-----|-----|
| EMEA  | 4.1 | 4.8 |
| APAC  | 2.7 | 3.9 |

同じ PDF です。違いは構造にあります。見出しのレベル、本物の表、そして間に割り込んでいた塊を挟んで元どおりにつながった段落。

変換を経ても残るもの

構造は句読点から推測するのではなく、レイアウトの幾何から導き出します。

見出しとリスト

見出しのレベルはフォントの相対的な大きさと太さから決まるため、H2 はただの段落に成り下がらず H2 のままです。番号付き・番号なしのリストは入れ子構造を保ち、太字・斜体・等幅の範囲は Markdown の強調とインラインコードとして引き継がれます。

罫線のある表もない表も

枠線のある表は罫線から検出します。枠線のない表 — 実際にはただ桁が揃ったテキストの列 — はセル位置をクラスタリングして見つけます。多くのコンバーターが匙を投げ、タブ区切りの断片を並べただけの代物を吐き出すのは、まさにこの場面です。

多段組の読み順

二段組のページは、段の間をジグザグに行き来する一本の流れとして本文を保持しています。素直に読むと、二行に一行が誤った場所から来てしまいます。まず段の境界を検出するので、次の段に移る前に各段を上から下まで読み切れます。

リンクと改ページの修復

ハイパーリンクの注釈は、ただの文字列に潰されることなく本物の Markdown リンクになります。ページの境界で切れた段落 — 二つの断片の間にヘッダー、フッター、ページ番号が挟まっていても — は縫い合わされ、一つの段落に戻ります。

一括変換

PDF が詰まったフォルダーをまるごと一つのジョブとして送れば、各 .md ファイルに加えて、それぞれに何が起きたかを記録した CONVERSION_REPORT.md を含む ZIP が返ってきます。一括処理が有効なプランでご利用いただけます。

既定で非公開

ファイルは TLS でアップロードされ、処理され、プランの保持期間が過ぎると自動的に削除されます。ページのプレビューはブラウザー内で生成されるため、変換をやめた PDF が端末から出ていくことはありません。

PDF コンバーターが破綻する四つの場面

PDF は字形を座標に保存します。段落も表も読み順も保存しません。それらはすべて推論するしかありません。その推論が乗り越えなければならないのが以下です。

二段組のレイアウト

問題

学術論文、ニュースレター、年次報告書は本文を段に組みますが、その下にあるコンテンツの流れはしばしばページを横切って走ります。保存順に取り出すと、A 段の 1 行目、次に B 段の 1 行目、次に A 段の 2 行目 — 交互に絡まり、意味を成さない代物になります。解析器はまず段間の縦の余白を検出し、各段を独立した塊として読みます。

罫線のない表

問題

罫線が一本も引かれていない表は珍しくありません。人がそれを表と読めるのは、値の桁が揃っているからにすぎません。検出すべき線がない以上、手がかりは各行で本文がどこから始まりどこで終わるかという幾何的な解析だけです。行と列はその整列から推論され、Markdown の表として組み直されます。

改ページで切られた段落

問題

4 ページ下部で始まり 5 ページ上部で終わる文は、二つの半分の間に柱(ヘッダー)、フッター、ページ番号を抱えています。これら繰り返し現れる要素はページをまたいで特定され取り除かれ、二つの断片は一つの段落へと結び直されます。

文字がまったくないページ

問題

スキャンされたページに入っているのは画像であって文字ではありません。文字どおり抽出すべきものが存在しないのです。黙って空白の節を出力する代わりに、そうしたページは数えられ、ページ番号とともに報告されます。おかげで短い出力は不具合に見えるのではなく説明されます。OCR を有効にすれば、そのページも読み取られます。

スキャンされたページ:既定で報告し、求めに応じて読み取る

テキスト層のないページがあれば、コンバーターは黙って短いファイルを作るのではなく、どのページが該当したかを伝えます。任意の OCR はそれらのページを文字として読み取ります。既定でオフにしてあるのは、これが無料の改善ではなく実際のトレードオフだからです。

取り戻せるもの

見出し、リスト、表、読み順はすべて戻ります。これらはフォントのメタデータではなく、ページ上での単語の位置から導かれるためです。

その代償

1 ページあたり約 1.5 秒。OCR なしの約 50 ミリ秒に対しておよそ 30 倍の遅さで、1 文書あたり 50 ページが上限です。

取り戻せないもの

太字と斜体です。OCR の出力にはフォント情報がまったく含まれないため、認識されたページの強調は完全に失われます。品質の悪いスキャンでの誤認識も想定内です。

OCR は単体の OCR ツールと同じプラン権限を使います。この方法で読み取られたページは結果に別途一覧されるので、文書のどの部分を確かめるべきかが正確に分かります。

多数のファイルをまとめて変換する

一括モードは、現実の PDF フォルダーには必ず一つは厄介なファイルが混じっている、という前提で作られています。

1

一つのジョブ、一つの ZIP

各 PDF は一つの書庫の中でそれぞれの .md ファイルになります。ドキュメントの移行は、単調な繰り返しではなく、一度のアップロードと一度のダウンロードで済みます。

2

一つの不良ファイルが全体を沈めることはない

破損したファイルやロックされた PDF は、それ単独で失敗します。残りは通常どおり変換され、ダウンロードできる状態のまま残ります。ファイル一つのために振り出しに戻ることはありません。

3

何が起きたかの記録

ZIP 内の CONVERSION_REPORT.md が、各元ファイルの結果を記録します。変換されたページ、スキャンだったページ、処理できなかったページまで。

4

ファイルごとのパスワード

保護された PDF が同じパスワードを共有していることはめったにありません。ロックされた各ファイルには専用の入力欄があり、アップロード前にブラウザー内で確認されるため、打ち間違いは長い転送のあとではなく即座に分かります。

Markdown、プレーンテキスト、それとも Word?

三つとも PDF から言葉を取り出します。違うのは、文書の形がどれだけ一緒に付いてくるか、そしてその後に何ができるかです。

Markdownプレーンテキスト(.txt)Word(.docx)
見出し# のレベルとして保持失われるスタイルとして保持
Markdown の表失われる保持される
差分で読みやすいはいはいいいえ — バイナリ形式
GitHub、Wiki、ドキュメントサイトで表示そのままコードブロックとして変換なしでは不可
LLM や検索インデックスへの入力最適 — 構造が残る使えるが構造は失われる先に抽出が必要
どのテキストエディターでも編集可能はいはいいいえ

目安として、読まれる・バージョン管理される・さらに処理される文章なら Markdown、組み直して印刷するなら Word です。

PDF を Markdown に変換する手順

試すのにアカウントは不要で、インストールするソフトもありません。

1

PDF を追加する

ページのどこにでもファイルをドラッグするか、選択ボタンを使ってください。各ファイルには 1 ページ目のサムネイルとページ数が付きます。いずれもブラウザー内で生成されます。

2

オプションを設定する

必要なら埋め込み画像を取り出し、スキャンされたページ向けに OCR を有効にし、ロック表示されたファイルにはパスワードを入力してください。

3

変換する

1 件ならすぐに変換されます。複数の場合は一括ジョブとしてキューに入り、まとめて処理され、1 件終わるごとに進捗が表示されます。

4

ダウンロードして注記を読む

.md ファイルが得られます。画像を取り出した場合や複数ファイルを変換した場合は ZIP になります。通知が出たら読んでください。どのページに注意が必要だったかが書かれています。

実際に使われている場面

PDF を、機械やバージョン管理が扱えるテキストに変える必要があるあらゆる場面で。

ドキュメントの移行

PDF に閉じ込められた旧来のマニュアル、作業手順書、仕様書が、見出しと表を保ったままドキュメントサイトや Wiki、リポジトリへ移ります。打ち直しも、書式を整え直す工程も要りません。

RAG パイプラインと LLM のコンテキスト

検索の品質はチャンク分割に大きく左右され、チャンク分割は構造に左右されます。Markdown の見出しは分割器に切るべき本物の境界を与えます。プレーンテキストにはそれが端からありません。

調査とノート作成

論文を Obsidian や Notion、Logseq へ、節と表を保ったまま取り込めます。引用や図が、元の見出しと結び付いたまま残ります。

バージョン管理下の文書

Markdown は git で行単位に差分が取れます。一度変換した契約書や規程は、その後コードと同じワークフローで追跡・レビュー・承認できます。

静的サイトや CMS のコンテンツ

Markdown は Hugo、Jekyll、Astro、Docusaurus、そして大半のヘッドレス CMS にとって本来の入力形式です。変換したファイルはそのままコンテンツ用ディレクトリに置けます。

レポートからのデータ抽出

財務諸表や調査報告は数値を表の中に埋めてしまいます。Markdown の表は解析がごく簡単なので、その数値がスクリプトの手の届く場所に出てきます。

できないこと

先に知っておく価値があります。失敗の仕方を隠すコンバーターより、それを名指しするコンバーターのほうが信頼しやすいからです。

難しいページは隠さず報告します

スキャンだったページ、解析できなかったページ、表の検出には複雑すぎたページは、いずれも結果にページ番号付きで報告されます。複雑なページも本文は段落として出力されます。失われるのは表の形です。

サイズとページ数の上限はプラン由来です

最大ファイルサイズ、1 文書あたりのページ数、1 バッチあたりのファイル数はすべてプランで決まり、アップロード欄の横のパネルに表示されます。表示される数値は常に現在のあなたのものです。

暗号化されたファイルにはパスワードが要ります

ロックされた PDF はパスワードなしには読めません。パスワードはその一度の変換にのみ使われ、事前にブラウザー内で検証され、保存されることはありません。

よくある質問

スキャンされた PDF でも使えますか?

OCR なしでは使えません。スキャンされたページには文字ではなく画像が入っており、抽出すべきものがないからです。コンバーターはどのページがスキャンだったかを正確に伝え、OCR を有効にすればそれらが読み取られます。処理はかなり遅くなり、該当ページでは太字と斜体が失われる点はご承知おきください。

表は本当に保持されるのですか、それとも近似ですか?

罫線のある表も、枠線のない桁揃えの段組も、どちらも検出して Markdown の表として組み直します。きわめて複雑なページ — 結合セル、入れ子の表、装飾の強いレイアウト — は素の段落に退避し、そのページは結果に一覧されるので、どこを確認すべきかが分かります。

PDF 内の画像はどうなりますか?

既定では省かれ、単一の .md ファイルが得られます。「埋め込み画像を取り出す」にチェックを入れると、Markdown と images/ フォルダーを含む ZIP になり、Markdown から取り出した各ファイルへリンクが張られます。

複数の PDF を一度に変換できますか?

一括処理が有効なプランなら可能です。ファイルは一つのジョブとしてキューに入り、変換レポートを添えた ZIP で返ります。そのプラン機能がなくても、何件でも一つずつ変換できます。

二段組の学術論文はどう扱われますか?

本文を読み始める前に段の境界を検出するので、各段を順番に上から下へ処理します。この工程がないと、抽出は行ごとに段を行き来し、出力は使い物になりません。多くのツールがとりわけ論文でつまずくのは、まさにこれが理由です。

パスワード保護された PDF は変換できますか?

できます。ロックされたファイルには専用カードにパスワード欄が表示され、何かがアップロードされる前にブラウザー内で検証されるため、誤ったパスワードは即座に分かります。一括処理では、ファイルごとに異なるパスワードを設定できます。

どれくらいの大きさのファイルを変換できますか?

ご利用のプランによります。アップロード欄の下に表示される上限が現在のあなたの上限で、固定値ではなくアカウントから随時読み取られるため、プランを上げればすぐに引き上がります。

出力された Markdown はそのまま公開できますか?

たいていはそれに近い状態です。見出し、リスト、表、リンクはきれいに出力され、結果は標準的な CommonMark なので GitHub や Wiki、静的サイトジェネレーターで表示できます。レイアウトが特殊な文書はひととおり目を通す価値があり、結果の通知がどこを見ればよいかを教えてくれます。

ファイルはどれくらい保管されますか?

アップロードしたファイルと変換結果は、アップロード欄の下に表示されるプランの保持期間を過ぎると自動的に削除されます。ダウンロード画面から変換済みファイルをすぐ削除することもできます。

アカウントは必要ですか?

不要です。ファイルサイズ、ページ数、1 日あたりの変換回数について匿名プランの上限内であれば、ログインせずに変換できます。ログインするとそれらの上限が引き上がり、ファイルの保管期間も延びます。

関連ツール

PDF から中身を取り出す、あるいは PDF に入れる他の方法。

Related Guides

Common document management mistakes small business make
General

Common document management mistakes small business make

Discover the most common document management mistakes small businesses make and learn simple ways to organize, store, share, and manage important files efficiently." focus_keyword: Document Management Mistakes

2026年8月31日5 min read
The Difference Between Storing Documents and Actually Managing Them
General

The Difference Between Storing Documents and Actually Managing Them

Learn the difference between storing documents and actually managing them. Discover how better organization, version control, PDF tools, and workflows save time." focus_keyword: Document Storage vs Document Management

2026年8月31日5 min read
PDF Techno vs iLovePDF OCR: Which Is More Accurate?
General

PDF Techno vs iLovePDF OCR: Which Is More Accurate?

Compare PDF Techno vs iLovePDF OCR for text accuracy, scanned PDFs, multilingual documents, tables, ease of use, and overall OCR performance.

2026年8月31日5 min read
PDF Techno vs Smallpdf PDF to JPG: Which Is Better?
General

PDF Techno vs Smallpdf PDF to JPG: Which Is Better?

Compare PDF Techno vs Smallpdf PDF to JPG conversion for image quality, text clarity, scanned documents, file size, ease of use, and overall results.

2026年8月26日5 min read
Edit PDF vs Repair PDF: What's the Difference and Which One Do You Need?
General

Edit PDF vs Repair PDF: What's the Difference and Which One Do You Need?

Confused between editing a PDF and repairing one? Learn the difference, when to use each option, and how PDF Techno helps you edit and repair PDF files quickly.

2026年7月15日5 min read
PDF Security Checklist: 10 Things You Should Do Before Sharing a File
General

PDF Security Checklist: 10 Things You Should Do Before Sharing a File

Protect your sensitive documents with this PDF security checklist. Learn 10 essential steps to secure your PDF before sharing it online using PDF Techno.

2026年7月15日5 min read