PDFをテキストに変換
PDFのテキストレイヤーを.txtファイルに抽出します。スキャン(画像のみ)のPDFからはテキストを取得できません。
このツールはファイルをアップロードしません。タブを閉じれば何も残りません。
ここにファイルをドラッグ&ドロップするか、
ファイルを選択対応形式: PDF · またはCtrl+Vで貼り付け
体裁は要らない、中身だけ欲しい
書式がむしろ邪魔になることがあります。報告書から数段落を引用したい、翻訳ツールやチャットの入力欄にまとめて貼りたい、文字数を数えたい、複数の資料から特定の条項を探したい、といった場合です。テキストファイルであれば、どのエディタでも表計算でもスクリプトでもそのまま扱えます。
出力はUTF-8なので、日本語も記号も崩れずに残ります。並び順はPDFの内部に記録された順序に従いますが、それが読む順序と一致するとは限りません。二段組みのページでは左右の行が交互に混ざることがあり、表は桁が揃わない行の羅列になり、ヘッダーやフッターはページごとに繰り返し現れます。使う前に一度ざっと目を通しておくと安全です。
スキャンした書類からは何も出てきません。ページに入っているのは文字ではなく文字の画像だからで、それを読み取るのはpdf-ocrの役目です。同じ文章を編集できるWordファイルとして受け取りたいならpdf-to-docxがありますが、あちらも運ばれるのは文字だけで、レイアウトは再現されません。抽出はブラウザ内で行われ、ファイルが外部に送られることはありません。
使い方
- 1
PDFを選択します。
- 2
必要に応じてページ範囲を指定します。
- 3
開始を押して結果をダウンロードします。
よくある質問
- 結果が空です。
- スキャンしたPDFにはテキストレイヤーがありません。その場合はAI変換ツールをご利用ください。
- 改行がおかしいです。
- PDFは行構造を保存していないため、位置から推定します。段組みのレイアウトでは順序が混ざることがあります。