PDF转文本
将 PDF 的文字层提取为 .txt 文件。扫描(纯图片)PDF 无法提取文字。
此工具不会上传您的文件。关闭标签页后不会留下任何内容。
将文件拖放到此处,或
选择文件支持格式: PDF · 或按 Ctrl+V 粘贴
只要文字,不要格式
有时候格式恰恰是麻烦本身。你可能要从报告里引用几段话,把整份文档贴进翻译工具或对话框,统计字数,或者在一堆材料里查找某个条款。纯文本文件可以直接丢进任何编辑器、表格或脚本里处理。
输出为UTF-8编码,中文和各类符号都不会乱码,文字顺序遵循PDF内部记录的次序。这个次序未必等于阅读顺序:双栏页面可能左右交错,表格会变成对不齐的若干行,页眉页脚则在每一页重复出现。真正拿去用之前,先通读一遍最稳妥。
扫描件什么都提取不出来,因为页面里装的是文字的图像而不是文字本身,读取它是pdf-ocr的工作。如果想把同样的文字拿成可编辑的Word文件,可以用pdf-to-docx,不过那边同样只带文字,版面一样不会保留。提取在浏览器里完成,文件不会被发送到任何地方。
使用方法
- 1
选择一个 PDF。
- 2
可选:设置页面范围。
- 3
点击开始并下载结果。
常见问题
- 结果是空的。
- 扫描 PDF 没有文字层。请对此类文件使用 AI 转换工具。
- 换行看起来不对。
- PDF 不存储行结构,只能根据位置推断。多栏排版可能会交错。