PDF转文本

将 PDF 的文字层提取为 .txt 文件。扫描(纯图片)PDF 无法提取文字。

此工具不会上传您的文件。关闭标签页后不会留下任何内容。

将文件拖放到此处,或

选择文件

支持格式: PDF · 或按 Ctrl+V 粘贴

只要文字,不要格式

有时候格式恰恰是麻烦本身。你可能要从报告里引用几段话,把整份文档贴进翻译工具或对话框,统计字数,或者在一堆材料里查找某个条款。纯文本文件可以直接丢进任何编辑器、表格或脚本里处理。

输出为UTF-8编码,中文和各类符号都不会乱码,文字顺序遵循PDF内部记录的次序。这个次序未必等于阅读顺序:双栏页面可能左右交错,表格会变成对不齐的若干行,页眉页脚则在每一页重复出现。真正拿去用之前,先通读一遍最稳妥。

扫描件什么都提取不出来,因为页面里装的是文字的图像而不是文字本身,读取它是pdf-ocr的工作。如果想把同样的文字拿成可编辑的Word文件,可以用pdf-to-docx,不过那边同样只带文字,版面一样不会保留。提取在浏览器里完成,文件不会被发送到任何地方。

使用方法

  1. 1

    选择一个 PDF。

  2. 2

    可选:设置页面范围。

  3. 3

    点击开始并下载结果。

常见问题

结果是空的。
扫描 PDF 没有文字层。请对此类文件使用 AI 转换工具。
换行看起来不对。
PDF 不存储行结构,只能根据位置推断。多栏排版可能会交错。

相关工具