OCR для PDF
Распознайте корейский и английский текст в сканированных PDF и получите PDF с поиском плюс текстовый файл.
Этот инструмент не загружает ваши файлы. Закройте вкладку, и ничего не останется.
Перетащите файлы сюда или
Выбрать файлыПоддерживаются: PDF · или вставьте с помощью Ctrl+V
По скану поиск ничего не находит
В папке с отсканированными договорами тридцать файлов, а поиск по номеру договора не даёт ничего, потому что в скане не сохранены буквы, сохранены изображения букв. Распознавание текста смотрит на эти изображения и записывает, какие знаки на них видны. Только после этого документ можно искать, а текст копировать.
Важное ограничение сразу: выбрать можно корейский с английским, только английский, только корейский, японский с английским или упрощённый китайский с английским, русского в этом списке нет. Кириллица не поддерживается, поэтому для русскоязычных документов инструмент результата не даст, и это стоит знать до того, как прогонять через него архив. Там, где язык подходит, всё решает исходный материал: около 300 точек на дюйм, лист уложен ровно, освещён равномерно, контраст отчётливый. Страницы, снятые телефоном, с тенью, изгибом бумаги и косой перспективой, распознаются заметно хуже планшетного скана, а рукописный текст не читается вовсе.
На выходе получается либо чистый текст, либо PDF с возможностью поиска, где изображение страницы остаётся видимым без изменений, а распознанные знаки лежат под ним невидимым слоем; документ выглядит как прежде, но отзывается на поиск. Если в файле уже есть настоящий текст, обычная выгрузка текста будет точнее, быстрее и без ошибок. Распознавание целиком работает в браузере на вашем устройстве, документ не отправляется на анализ в облако, а для паспортов, договоров и медицинских выписок это существенная разница.
Как пользоваться
- 1
Выберите сканированный PDF.
- 2
Проверьте языки и нажмите «Начать».
- 3
Скачайте PDF с поиском и .txt.
Часто задаваемые вопросы
- Сколько это занимает?
- Примерно 3–10 секунд на страницу. При первом запуске загружается ~4 МБ языковых данных.
- Точность?
- Высокая для чистых распечаток, ниже для размытых сканов или рукописного текста. Структура таблиц не распознаётся.