画像をテキストに変換(OCR)

無料のオンラインOCR。画像、スクリーンショット、写真、スキャンしたPDFから24言語の文字を抽出できます。処理はブラウザ内で行われ、ファイルはアップロードされません。

ここにファイルをドラッグするか、Ctrl+V(Macでは⌘+V)でスクリーンショットを貼り付けることもできます。 文字認識はブラウザ内で行われます。ファイルはどこにも送信されず、アップロードも保存もされません。
各言語のデータは一度だけダウンロードされ(1〜3 MB)、その後はブラウザに保存されます。ラテン文字の単語が混ざる場合は、第2言語に英語を追加してください。

できること


このツールはOCR(光学文字認識)を使い、画像内の文字をコピー・編集・検索できるテキストに変換します。スクリーンショット、書類の写真、スキャンしたページ、画像だけのPDFに対応しています。認識はオープンソースのOCRエンジンTesseractがお使いのブラウザ内で行うため、ファイルが端末の外に出ることはありません。小さな文字は読み取り前に自動で拡大され、誤認識が大きく減ります。

使い方


  1. 画像(複数可)またはPDFを選択するか、ここにドラッグするか、スクリーンショットを貼り付けます。
  2. テキストの言語を確認します。読み取りは自動で始まります。言語を変更した場合は、もう一度「テキストを抽出」を押してください。
  3. 結果を確認して誤認識を修正し、コピーするか .txt ファイルとしてダウンロードします。

よくある質問


画像はアップロードされますか?
いいえ。認識エンジンと言語データがブラウザにダウンロードされ、画像やPDFはそこで処理されます。サーバーには何も送信されないため、機密文書にも安心して使えます。

精度はどのくらいですか?
鮮明な印刷文字なら、ラテン文字の言語では通常99%以上の文字を正しく認識し、その他の文字体系ではおおむね93%〜99%です。ぼやけた写真、低いコントラスト、湾曲したページ、装飾的なフォント、手書き文字では精度が下がります。最良の結果を得るには、鮮明で明るく、まっすぐな画像を使い、正しい言語を選んでください。

対応している言語は?
24言語:英語、ポルトガル語、スペイン語、フランス語、ドイツ語、イタリア語、スウェーデン語、アフリカーンス語、トルコ語、インドネシア語、マレー語、フィリピン語、ベトナム語、ロシア語、アラビア語、ウルドゥー語、ヒンディー語、タミル語、タイ語、クメール語、日本語、韓国語、中国語(簡体字・繁体字)。2つの言語が混在する文章では、言語を組み合わせて使えます。

手書き文字は読み取れますか?
あまり得意ではありません。エンジンは印刷文字で学習しているため、丁寧に書かれたブロック体なら読めることもありますが、続け字の手書きは通常うまく認識できません。

スキャンしたPDFにも使えますか?
はい。各ページを高解像度でレンダリングして順に読み取り、ページの区切りを示すこともできます。選択できるテキストがすでに含まれるPDFなら、「PDFをテキストに変換」ツールの方が速く正確です。

Wikipedia — Optical character recognition
Wikipedia — Tesseract (software)