OCR

Reconheça texto em coreano e inglês em PDFs digitalizados e gere um PDF pesquisável mais um arquivo de texto.

Esta ferramenta não envia seus arquivos. Feche a aba e nada fica para trás.

Arraste e solte os arquivos aqui, ou

Escolher arquivos

Compatíveis: PDF · ou cole com Ctrl+V

Um digitalizado onde a busca não acha

Um contrato antigo que só existe em papel, um processo que chegou escaneado, uma correspondência digitalizada e salva em PDF: dá para ler na tela, mas Ctrl+F não retorna nada. Para o computador aquelas páginas são fotografias, então não há como buscar uma cláusula, copiar um trecho ou conferir vários arquivos de uma vez.

O reconhecimento é escolhido entre algumas combinações de idiomas —coreano e inglês, inglês, coreano, japonês e inglês, chinês simplificado e inglês— e o português não está entre elas, então de um documento em português não sai resultado aproveitável. Dentro dos idiomas suportados, a precisão depende quase inteiramente da qualidade da digitalização, em torno de 300 dpi, folha reta e iluminação uniforme. O resultado pode vir como texto puro ou como um PDF com camada de texto invisível sobre a imagem, que mantém a aparência original e passa a permitir busca.

Nenhum OCR é infalível: confira números, nomes próprios e qualquer dado que for reaproveitar. Se o PDF já tiver texto de verdade, gerado por um programa e não por um scanner, a extração de texto é mais rápida e mais exata. O reconhecimento roda no navegador, então documentos sigilosos não saem do seu computador.

Como usar

  1. 1

    Selecione um PDF digitalizado.

  2. 2

    Confira os idiomas e clique em Iniciar.

  3. 3

    Baixe o PDF pesquisável e o .txt.

Perguntas frequentes

Quanto tempo leva?
Cerca de 3–10 segundos por página. A primeira execução baixa ~4 MB de dados de idioma.
Precisão?
Alta para impressos limpos, menor para digitalizações borradas ou manuscritos. A estrutura de tabelas não é reconhecida.

Ferramentas relacionadas