PDFテキスト抽出
PDFから文字を取り出してコピー・保存します。
ブラウザ内で動作します。ファイルが端末から出ることはありません。
- コピーまたは.txtでダウンロード
- 複数PDFをまとめて変換
- アップロード不要
PDFをテキストに変換する方法
- PDFファイルをここにドロップします。
- 文字が抽出されるのを待ちます。
- コピーするか、PDFごとに.txtファイルをダウンロードします。
抽出で保たれるものと失われるもの
- すべてのページのプレーンテキストを、ページ間を空行でつないで抽出します。
- 読み取り順序はPDF内部のテキスト順序に従うため、見た目のレイアウトと必ずしも一致しません。
- フォント、太字・斜体の装飾、色、画像は保持されず、単語そのものだけが残ります。
- 表や段組みのページは、きれいな読み順ではなくセルや段が入り混じって出力されることがあります。
1ファイルか複数ファイルか
PDFを1つだけ処理すると、抽出されたテキストはページ上のコピー用ボタン付きのボックスにも表示され、そのまま他の場所に貼り付けられます。
2つ以上のPDFを処理すると、複数の文書を1つのボックスに表示しても役立たないため、それぞれが個別の.txtファイルとしてダウンロードされるか、まとめて1つのZIPになります。
PDFから文字を抽出する良い理由
- 契約書の段落や条項を、手で打ち直さずにメールへコピーする。
- レポートの文章をワープロに取り込んで自由に編集できるようにする。
- 2つのバージョンのプレーンテキストを差分比較ツールに貼り付けて見比べる。
- PDFの文字を、文字数カウンターのようなプレーンテキストしか読めない他のツールに読み込ませる。
PDFからテキストへのFAQ
テキストファイルが空になるのはなぜですか?
スキャンされたPDFはテキスト層のないページの写真なので、抽出できるものがありません。代わりに画像からテキストを読み取る「画像からテキスト」を使ってください。
元の書式は保たれますか?
いいえ。段組みや表、フォントは保持されず、ページに現れるおおよその順序でプレーンテキストのみが得られます。
複数のPDFを一度に変換できますか?
はい。好きなだけドロップして、各.txtファイルをダウンロードするか、まとめて1つのZIPでダウンロードできます。
文書はアップロードされますか?
いいえ。テキストの抽出はすべてブラウザ内で行われます。
段落や改行は保たれますか?
各ページのテキストは空行で区切られます。ページ内の改行はPDF内部のテキスト順序に従うため、通常は目に見える行と一致しますが、必ずしも保証はされません。
段組みレイアウトは正しい順序で抽出されますか?
常にそうとは限りません。抽出はPDFが文字を格納している順序に従うもので、見た目の段組みには従わないため、2段組みのページは段が入り混じって出力されることがあります。
パスワード保護されたPDFでも使えますか?
直接は使えません。先にPDFのロック解除でパスワードを外し、ロック解除したファイルをこのツールにかけてください。
ページの一部だけに本物の文字がある場合はどうなりますか?
その部分は通常どおり抽出されます。文字の段落とスキャン画像が混在するページでは、画像部分には読み取れるテキスト層がないため、文字の段落だけが返されます。