PDF→Markdown/テキスト変換 — ChatGPT・Claudeへの貼り付け用
PDFを、見出し・表・箇条書きを保ったままMarkdownに変換します。 LLMへのプロンプトにそのまま貼り付けられる形です。対応ブラウザでは 処理がブラウザ内で完結し、ファイルが端末の外に出ることはありません。 読み取れないPDF(スキャン画像など)は、その旨をお伝えして処理を中止します。
こんな場面で使えます
LLMにコンテキストを渡したい人
PDFビューアからのコピペだと書式やページ構成が崩れる
変換したMarkdownをそのままプロンプトに貼り付ける。表も表のまま渡せる
リサーチャー・アナリスト
レポート中の数表を、手で打ち直さずに使いたい
表をMarkdownの表として取り出し、そのまま集計や要約に回す
開発者
PDFの中身を使う処理を書く前に、テキストレイヤーの中身を確認したい
重いPDFライブラリを入れる前に、抽出結果と表の検出状況を確認する
書類を受け取る立場の人
PDFの文字がコピーできない、コピーすると文字化けする
変換して確認する。読み取れないPDFなら、その理由が表示される
FAQ
- ファイルはサーバーに保存されますか?
- いいえ。お使いのブラウザがWebAssembly(WASM、ソフトウェアをブラウザ内 で安全かつ高速に実行する技術)に対応していれば、ファイルは端末の外に 出ません。対応していない場合は通常どおりサーバー側で処理しますが、そ の場合も、ファイルは変換中だけ保持し、変換が終わった時点で削除します。 結果もお渡しした時点で削除します。いずれの場合も保存は行いません。
- 表は取り出せますか?
- 取り出せます。罫線のある表はもちろん、罫線がなく文字の位置だけで 組まれた表も検出し、Markdownの表として出力します。何ページで表が 見つかったかは変換後の要約に表示されます。
- スキャンしたPDF(文字情報を持たないPDF)にも対応していますか?
- 対応していません。ただし、変換を試みて空の結果を返すことはしません。 スキャン画像であることを判定し、「このPDFはスキャン画像で、文字データを 含んでいません」とお伝えして処理を中止します。読み取るにはOCR (画像から文字を読み取る処理)が必要ですが、このツールは対応していません。
- 文字が正しく読み取れないPDFはどうなりますか?
- フォントの埋め込み方式によっては、PDFに文字が入っていても正しく 読み取れないことがあります(日本語のPDFで起こりやすい形式があります)。 その場合も、意味のない文字列を出力するのではなく、読み取れなかったことを お伝えして処理を中止します。一部のページだけが読み取れない場合は、 読めたページを変換したうえで「何ページが結果に含まれていないか」を明示します。
- トークン数の目安はどう算出していますか?
- 文字数ベースの簡易的な概算であり、正確なトークナイザーではありません。 LLMのコンテキストウィンドウに収まりそうかどうかの目安としてご利用く ださい。
- ファイルサイズの上限は?
- 1ファイルあたり20MBまでです。
関連ツール
- PDFのページ分割 — 必要なページだけ取り出したいときに
- WordをMarkdownに変換 — 元の資料がWord・Excel・PowerPointのときはこちら
- 個人情報マスキング — 抽出したテキストを共有する前に、氏名や連絡先を消したいときに