PDFテキスト抽出の使い方
- 文字を取り出したいPDFファイルを選択します。選択するとすぐに、ページごとに抽出が始まります。
- ページの間に「----- 1ページ -----」のような区切り線が不要な場合は、チェックを外します。切り替えると結果にすぐ反映されます。
- 結果欄から必要な部分を選択してコピーするか、すべてコピーを押します。
- TXTで保存を押すと、メモ帳などで開けるUTF-8のテキストファイルとして保存されます。
PDFの文字がうまくコピーできない理由
PDFビューアで文字をドラッグしてコピーすると、改行がおかしな位置に入ったり、2段組みの文書で左右の段の文章が混ざったり、文字の間に不要なスペースが入ったりすることがよくあります。これは、PDFが「どの位置にどの文字を描くか」だけを記録しており、文章や段落の構造は保存していないためです。
このツールはPDFに記録された文字片の座標を読み取り、同じ高さにある文字片を1行にまとめ、行間が広い箇所は段落が変わったものとみなして空行を入れます。そのため、ビューアから直接コピーするよりも読みやすいテキストが得られます。
なお、行は横方向にまとめる仕組みのため、縦書きの文書では文字の並びが意図した順序にならない場合があります。
スキャンしたPDFはテキストを抽出できません
スキャナーやスマートフォンのカメラ、複合機のスキャン機能で作ったPDFは、ページ全体が1枚の画像になっています。見た目は文字でも、ファイルの中には文字情報がないため、抽出結果は空になります。この場合は画像内の文字を認識するOCR(光学文字認識)ソフトが必要で、このツールはOCRには対応していません。
スキャンしたPDFかどうかを確かめるには、PDFビューアで文字をドラッグしてみてください。文字単位で選択できず、ページ全体が選択される場合は画像のPDFです。
抽出したテキストの活用のヒント
よくある質問
PDFのテキスト抽出結果が空になります。
スキャンや写真から作ったPDFには文字情報がないため、抽出できません。その場合はOCR機能のあるソフトを使う必要があります。
日本語が文字化けしてしまいます。
一部のPDFはフォント情報を特殊な方法で保存しており、文字コードが本来の文字と異なる形で記録されています。このような文書は、どの抽出ツールでも正確な文字を得るのが難しいです。
パスワード付きのPDFも使えますか?
閲覧(開く)パスワードが設定されたPDFは読み込めません。パスワードを解除したコピーを作成してからご利用ください。
抽出した内容はサーバーに残りますか?
いいえ。PDFの解析とテキスト抽出はすべてブラウザ内で行われ、ファイルや結果がどこかに送信されることはありません。
縦書きのPDFも抽出できますか?
文字情報があれば抽出はされますが、このツールは同じ高さの文字を1行にまとめるため、縦書きの文書では文字の順序が崩れる場合があります。