PDFをテキストに変換

PDFのテキストレイヤーを.txtファイルに抽出します。スキャン(画像のみ)のPDFからはテキストを取得できません。

このツールはファイルをアップロードしません。タブを閉じれば何も残りません。

ここにファイルをドラッグ&ドロップするか、

ファイルを選択

対応形式: PDF · またはCtrl+Vで貼り付け

体裁は要らない、中身だけ欲しい

書式がむしろ邪魔になることがあります。報告書から数段落を引用したい、翻訳ツールやチャットの入力欄にまとめて貼りたい、文字数を数えたい、複数の資料から特定の条項を探したい、といった場合です。テキストファイルであれば、どのエディタでも表計算でもスクリプトでもそのまま扱えます。

出力はUTF-8なので、日本語も記号も崩れずに残ります。並び順はPDFの内部に記録された順序に従いますが、それが読む順序と一致するとは限りません。二段組みのページでは左右の行が交互に混ざることがあり、表は桁が揃わない行の羅列になり、ヘッダーやフッターはページごとに繰り返し現れます。使う前に一度ざっと目を通しておくと安全です。

スキャンした書類からは何も出てきません。ページに入っているのは文字ではなく文字の画像だからで、それを読み取るのはpdf-ocrの役目です。同じ文章を編集できるWordファイルとして受け取りたいならpdf-to-docxがありますが、あちらも運ばれるのは文字だけで、レイアウトは再現されません。抽出はブラウザ内で行われ、ファイルが外部に送られることはありません。

使い方

  1. 1

    PDFを選択します。

  2. 2

    必要に応じてページ範囲を指定します。

  3. 3

    開始を押して結果をダウンロードします。

よくある質問

結果が空です。
スキャンしたPDFにはテキストレイヤーがありません。その場合はAI変換ツールをご利用ください。
改行がおかしいです。
PDFは行構造を保存していないため、位置から推定します。段組みのレイアウトでは順序が混ざることがあります。

関連ツール