OCR
Herken Koreaanse en Engelse tekst in gescande PDF's en maak een doorzoekbare PDF plus een tekstbestand.
Deze tool uploadt je bestanden niet. Sluit het tabblad en er blijft niets achter.
Sleep bestanden hierheen, of
Bestanden kiezenOndersteund: PDF · of plak met Ctrl+V
Zoeken in een scan levert niets op
De map met ingescande contracten bevat dertig bestanden, en zoeken op een contractnummer geeft nul resultaten, omdat in een scan geen letters zijn opgeslagen maar afbeeldingen van letters. Tekstherkenning kijkt naar die afbeeldingen en noteert welke tekens erop te zien zijn. Daarna is het document doorzoekbaar en kunt u de tekst eruit kopieren.
Een belangrijke beperking vooraf: u kiest uit Koreaans met Engels, alleen Engels, alleen Koreaans, Japans met Engels en vereenvoudigd Chinees met Engels, en Nederlands zit daar niet bij. Nederlandstalige stukken worden daarom niet betrouwbaar herkend, en juist bij eigennamen, accenten en bedragen is het resultaat dan onbruikbaar. Waar de taal wel past, hangt alles af van het uitgangsmateriaal: ongeveer 300 dpi, recht ingelegd, gelijkmatig belicht en met duidelijk contrast. Met de telefoon gefotografeerde pagina's met schaduw, bolling en een scheef perspectief geven veel slechtere resultaten dan een echte flatbedscan, en handschrift wordt helemaal niet gelezen.
U krijgt ofwel kale tekst, ofwel een doorzoekbare PDF waarin het paginabeeld onveranderd zichtbaar blijft en de herkende tekens er onzichtbaar onder liggen; het document ziet er dus uit als voorheen maar reageert wel op zoeken. Staat er al echte tekst in het bestand, dan is de gewone tekstuitvoer nauwkeuriger, sneller en foutloos. De herkenning draait volledig in de browser op uw eigen apparaat; het document gaat niet naar een clouddienst ter analyse, wat bij identiteitsbewijzen, contracten en medische stukken het verschil maakt.
Hoe werkt het
- 1
Selecteer een gescande PDF.
- 2
Controleer de talen en klik op Start.
- 3
Download de doorzoekbare PDF en .txt.
Veelgestelde vragen
- Hoe lang duurt het?
- Ongeveer 3–10 seconden per pagina. De eerste keer wordt ~4 MB aan taalgegevens gedownload.
- Nauwkeurigheid?
- Hoog voor schone afdrukken, lager voor wazige scans of handschrift. Tabelstructuur wordt niet herkend.