PDF文字识别(OCR)

识别扫描 PDF 中的韩文和英文文字,生成可搜索的 PDF 和文本文件。

此工具不会上传您的文件。关闭标签页后不会留下任何内容。

将文件拖放到此处,或

选择文件

支持格式: PDF · 或按 Ctrl+V 粘贴

搜不到内容的扫描件

一份旧合同、一叠发票或者拍下来的书页,眼睛看得清清楚楚,Ctrl+F却一条都找不到。因为扫描件里装的是文字的照片:你看到的是字,电脑看到的是一堆像素。光学字符识别就是把这些像素重新读成可以搜索、可以复制的字符。

识别语言有五种可选:韩文加英文、纯英文、纯韩文、日文加英文,以及简体中文加英文。中文材料选简体中文加英文这一项,夹在正文里的英文词和数字也能一并读出来。识别率几乎完全取决于原件质量,建议扫描时用三百dpi左右,页面摆正不要倾斜,光线均匀、装订缝处不要有阴影。手写体、盖在文字上的印章、带底纹的背景和颜色偏淡的复印件都会明显拉低准确率,金额、日期和单号这类数字一定要人工核对一遍。

结果可以直接取纯文本,也可以保存成可搜索的PDF:原来的扫描图像照旧显示,识别出的文字作为一层看不见的内容压在下面,外观和扫描件一模一样。识别完全在浏览器中运行,首次使用需要下载识别引擎,处理时间随页数增长,页数多的文档建议分批处理。如果这份PDF本来就是电子生成的而非扫描的,用pdf-to-text取到的是原字符,不会有识别错误。

使用方法

  1. 1

    选择扫描的 PDF。

  2. 2

    确认语言并点击开始。

  3. 3

    下载可搜索的 PDF 和 .txt。

常见问题

需要多长时间?
每页约 3–10 秒。首次运行会下载约 4 MB 的语言数据。
准确率如何?
清晰的打印件准确率高,模糊扫描或手写则较低。不识别表格结构。

相关工具