PDFをテキストに変換

PDF からテキストをオンラインで抽出。行や段落を保ったままページごとに取り出し、コピーや .txt ファイルでのダウンロードができます。無料・安全で、アップロードはありません。

ファイルはブラウザが読み込み、どこにも送信されません。アップロードも保存もありません。

できること


このツールは PDF のテキストを読み取り、コピー・編集したり .txt ファイルとして保存したりできるプレーンテキストとして返します。行と段落はページ上の単語の位置から再構成され、各ページの開始位置に印を付けることもできます。ワープロから書き出した文書など、実際のテキストを含む PDF であれば使えます。スキャンしたページは画像なので、抽出できるテキストはありません。

使い方


  1. PDF を選択します。
  2. 「テキストを抽出」を押します。長い文書は数秒かかります。
  3. テキストをコピーするか、.txt ファイルとしてダウンロードします。

よくある質問


PDF からテキストが見つからないのはなぜですか?
ページが画像だからです。スキャンした文書や、写真を PDF として保存した場合がそうです。その場合 PDF の中にはテキストがなくピクセルしかないため、読み取るには文字認識(OCR)が必要です。

レイアウトは保持されますか?
テキストの行と段落は保たれますが、フォント、段組み、画像は保持されません。2 段組みの文書では、1 行のテキストに両方の段が混ざることがあります。表はセルの間にスペースが入ったテキスト行になります。

文書は安全ですか?
はい。PDF はブラウザが読み込み、サーバーに送信されることはないため、個人的な文書にも使えます。

どの言語でも使えますか?
はい。PDF に実際のテキストが含まれ、フォントが文字を正しく対応付けていれば使えます。古い PDF や作りの悪い PDF では、画面上は正しく表示されても抽出すると文字化けすることがあります。これはファイル側の問題で、OCR でしか復元できません。

Wikipedia — PDF
Wikipedia — Optical character recognition