画像 文字起こし(OCR)

写真やスクリーンショットから文字を取り出す。

ブラウザ内で動作します。ファイルが端末から出ることはありません。

画像から文字を抽出する方法

  1. ここに写真やスクリーンショットをドロップします。
  2. 数秒待つとテキストが読み取られます。
  3. 結果をコピーまたはダウンロードします。

OCRが得意な文字と苦手な文字

元の画像結果
タイプ打ち文字のきれいなスクリーンショット非常に良好、信頼度は通常95%以上
印刷された文書のスキャンとても良好
正面から撮った看板やページの写真良好
角度がついた、ブレた、暗い写真精度が低く誤りが多い
手書き文字信頼性が低く、非常にきれいな印字体で最も良い結果

信頼度スコアの仕組み

OCRエンジンは抽出結果全体に対する信頼度をパーセンテージで返します。これは見つけた文字にどれだけ自信があるかというエンジン自身の推定値です。90前後を超えていればたいてい正確です。70未満の場合、特に少しの読み間違いで意味が変わる名前や数字、日付は、信頼する前に元の画像と照らし合わせて確認しましょう。

より良い結果を得るコツ

  • アップロード前に文字以外の部分、たとえば背景がごちゃごちゃした部分や写真は切り抜きましょう。OCRはすべてのパターンを文字として読み取ろうとします。
  • 角度をつけて撮った写真は、先にTabbyKitの「画像回転」ツールでまっすぐにしましょう。傾いた文字は行の検出を混乱させます。
  • 解像度が高いほど良い結果になりますが限度があります。ブレた高解像度の写真は、鮮明な低解像度の写真より読み取りが悪くなります。
  • むらのない適切な明るさで、映り込みのない照明は、明るくても照明にむらのある写真より優れています。
  • ページを正面からまっすぐスキャンした画像は、良いカメラで撮った同じページの手持ち写真より、ほぼ常に精度が上回ります。

このOCRエンジンの仕組み

このツールは、もともとHPで開発され現在はGoogleが管理しているオープンソースのOCRエンジン「Tesseract」を、WebAssemblyとしてブラウザ内で完全に動かしています。言語ごとの文字認識モデルは初めて選んだときに1回だけダウンロードされ、それ以降のすべての写真はサーバーを介さずお使いの端末上で読み取られます。

画像の文字起こしのFAQ

対応している言語は?

英語、スペイン語、ポルトガル語、フランス語、ドイツ語、イタリア語、インドネシア語、トルコ語、日本語、ロシア語、ベトナム語、ポーランド語、オランダ語、韓国語、タイ語、ウクライナ語、アラビア語の17言語を読み取れます。既定ではページの言語が選択されているので、画像を追加する前に「テキストの言語」のリストから別の言語も選べます。結果は鮮明な印刷物やタイプ打ちの文字で最も良くなります。

手書き文字も読み取れますか?

非常にきれいな手書き文字なら読み取れることもありますが、OCRは印刷された文字向けに作られているため、筆記体や乱雑な手書きは苦手です。

信頼度スコアとは何ですか?

OCRエンジン自身が文字の読み取りにどれだけ自信があるかを0〜100で示す推定値です。90前後を超えていればたいてい正確で、70未満の場合は元の画像と照らし合わせて確認してください。

写真よりスクリーンショットの方が精度が高いのはなぜですか?

スクリーンショットやスキャンは照明が均一でふちもくっきりしています。角度をつけて撮った写真や、影やブレのある写真はOCRにとって手がかりが少なくなります。

画像はサーバーにアップロードされますか?

いいえ。OCRエンジンは最初の1回だけブラウザにダウンロードされ、それ以降のすべての写真はお使いの端末上で読み取られます。

画像の読み取りに失敗したのはなぜですか?

これはめったに起こらず、画像ファイル自体がデコードできない場合だけです。別の写真を試すか、画面を撮った写真ではなく直接のスクリーンショットを使ってみてください。

抽出したテキストの一部だけをコピーできますか?

はい。結果は編集可能なテキストボックスに表示されるため、ダウンロード前に好きな部分を選択、コピー、編集できます。

PDFにも使えますか?

直接は使えません。先にPDFのページのスクリーンショットを撮るか画像として書き出し、その画像をここにドロップしてください。

スマートフォンでも使えますか?

はい。モバイル版のSafariやChromeを含め、すべてブラウザ内で動作します。非常に大きな写真の場合、古いスマートフォンでは数秒余分にかかることがあります。

関連ツール