PDF sang Text
Trích xuất lớp văn bản của PDF ra tệp .txt. PDF scan (chỉ có ảnh) sẽ không cho ra văn bản.
Công cụ này không tải tệp của bạn lên. Đóng tab là không còn gì lưu lại.
Kéo thả tệp vào đây, hoặc
Chọn tệpHỗ trợ: PDF · hoặc dán bằng Ctrl+V
Cần chữ bên trong, không cần bố cục
Có lúc thứ bạn cần không phải một tài liệu đẹp mà là câu chữ trong đó: trích một điều khoản vào ghi chú, tìm một thuật ngữ trong thông tư hai trăm trang, hay lấy nội dung báo cáo để tóm tắt bằng công cụ khác. Bôi đen từng trang trong phần mềm đọc PDF mất thời gian hơn nhiều so với rút toàn bộ ra một lần.
Kết quả là tệp .txt mã UTF-8, nên dấu tiếng Việt giữ nguyên khi mở ở bất cứ đâu, kể cả trên điện thoại. Thứ bị bỏ lại là bố cục: tài liệu hai cột có thể đọc thành so le, bảng biểu biến thành các dòng rời, còn tiêu đề và số trang sẽ xuất hiện lặp lại ở mỗi lần sang trang. Để đọc và tra cứu thì điều đó không cản trở, nhưng đừng kỳ vọng dựng lại được tài liệu từ tệp này.
Các trang scan sẽ không trả về chữ nào, vì với máy tính, chữ trên đó chỉ là một phần của bức ảnh; hãy dùng công cụ OCR cho loại tài liệu ấy. Nếu muốn sửa ngay trong Word, công cụ PDF sang Word cho ra tệp .docx, dù thứ theo sang đó cũng chỉ là phần chữ. Việc trích xuất chạy trong trình duyệt, không tải tệp lên đâu cả.
Cách sử dụng
- 1
Chọn một PDF.
- 2
Đặt phạm vi trang nếu cần.
- 3
Nhấp Bắt đầu và tải kết quả.
Câu hỏi thường gặp
- Kết quả trống.
- PDF scan không có lớp văn bản. Hãy dùng công cụ chuyển đổi AI cho những tệp đó.
- Ngắt dòng trông lạ.
- PDF không lưu cấu trúc dòng; nó được suy ra từ vị trí. Bố cục nhiều cột có thể bị xen lẫn.