PDF文字辨識(OCR)

辨識掃描 PDF 中的韓文與英文文字,產生可搜尋的 PDF 與文字檔。

此工具不會上傳您的檔案。關閉分頁後不會留下任何內容。

將檔案拖放到此處,或

選擇檔案

支援格式: PDF · 或按 Ctrl+V 貼上

搜尋不到內容的掃描檔

一份舊合約、一疊收據或拍下來的書頁,眼睛看得清清楚楚,Ctrl+F卻一筆都找不到。因為掃描檔裡放的是文字的照片:你看到的是字,電腦看到的是一堆像素。光學文字辨識就是把這些像素重新讀成可以搜尋、可以複製的字元。

語言可選韓文加英文、純英文、純韓文、日文加英文,以及簡體中文加英文,其中並沒有繁體中文的選項。繁體文件只能用簡體中文加英文那一項來跑,兩岸寫法相同的字多半讀得出來,但遇到寫法不同的字就會辨錯,品質相當參差,建議先拿一兩頁試過再決定整份值不值得做。辨識率同樣幾乎取決於原稿,建議掃描時用300dpi左右,頁面擺正不要歪斜,光線均勻、裝訂邊不要壓出陰影。手寫字、蓋在文字上的印章、有底紋的背景和顏色偏淡的影本都會明顯拉低準確率;金額、日期和單號這類數字一定要人工再核對一次。

結果可以直接取純文字,也可以存成可搜尋的PDF:原本的掃描影像照舊顯示,辨識出來的文字以看不見的一層壓在底下,外觀和掃描檔一模一樣。辨識完全在瀏覽器裡執行,第一次使用要先下載辨識引擎,處理時間隨頁數增加,頁數多的文件建議分批做。如果這份PDF本來就是電子產生而非掃描的,用pdf-to-text取到的是原始字元,不會有辨識誤差。

使用方法

  1. 1

    選擇掃描的 PDF。

  2. 2

    確認語言並按下開始。

  3. 3

    下載可搜尋的 PDF 與 .txt。

常見問題

需要多久?
每頁約 3–10 秒。首次執行會下載約 4 MB 的語言資料。
準確度如何?
清晰的列印件準確度高,模糊掃描或手寫則較低。不辨識表格結構。

相關工具