OCR PDF
Nhận dạng chữ Hàn và Anh trong PDF scan và tạo PDF tìm kiếm được kèm tệp văn bản.
Công cụ này không tải tệp của bạn lên. Đóng tab là không còn gì lưu lại.
Kéo thả tệp vào đây, hoặc
Chọn tệpHỗ trợ: PDF · hoặc dán bằng Ctrl+V
Bản scan không tìm được chữ nào
Hợp đồng cũ đã scan trông y hệt một tệp PDF bình thường, nhưng Ctrl+F không tìm ra chữ nào và cũng không bôi đen được. Lý do rất đơn giản: mỗi trang thực chất là một bức ảnh, và với máy tính thì chữ trên đó không khác gì họa tiết trên một tấm hình. Nhận dạng ký tự biến bức ảnh ấy thành chữ mà máy đọc được.
Cần nói rõ giới hạn quan trọng nhất: tiếng Việt không nằm trong danh sách ngôn ngữ được hỗ trợ, vốn gồm Hàn và Anh, Anh, Hàn, Nhật và Anh, cùng Trung giản thể và Anh. Văn bản tiếng Việt có dấu sẽ ra sai lệch nhiều đến mức không dùng được, nên công cụ này chỉ nên dùng cho tài liệu tiếng Anh. Với tài liệu tiếng Anh, chất lượng bản scan quyết định phần lớn kết quả: 300 dpi, trang thẳng không lệch, ánh sáng đều và không có bóng tay hay bóng điện thoại đổ lên giấy.
Kết quả có thể lấy ở dạng văn bản thuần hoặc dạng PDF tìm kiếm được, tức là vẫn giữ nguyên ảnh trang gốc và thêm một lớp chữ vô hình phía sau. Đừng dùng thẳng kết quả nhận dạng cho những con số quan trọng như giá trị hợp đồng mà không đối chiếu bản gốc. Quá trình nhận dạng chạy trên thiết bị của bạn, nên tài liệu nhạy cảm không đi đâu cả.
Cách sử dụng
- 1
Chọn PDF scan.
- 2
Kiểm tra ngôn ngữ và nhấp Bắt đầu.
- 3
Tải PDF tìm kiếm được và .txt.
Câu hỏi thường gặp
- Mất bao lâu?
- Khoảng 3–10 giây mỗi trang. Lần chạy đầu tải ~4 MB dữ liệu ngôn ngữ.
- Độ chính xác?
- Cao với bản in rõ, thấp hơn với scan mờ hoặc chữ viết tay. Không nhận dạng cấu trúc bảng.