PDF OCR

Koreanischen und englischen Text in gescannten PDFs erkennen und ein durchsuchbares PDF plus Textdatei erzeugen.

Dieses Tool lädt Ihre Dateien nicht hoch. Schließen Sie den Tab, und nichts bleibt zurück.

Dateien hierher ziehen oder

Dateien auswählen

Unterstützt: PDF · oder mit Strg+V einfügen

Im Scan findet die Suche nichts

Der Ordner mit den eingescannten Verträgen enthält dreißig Dateien, und die Suche nach einer Vertragsnummer liefert nichts, weil in einem Scan keine Buchstaben gespeichert sind, sondern Bilder von Buchstaben. Texterkennung sieht sich diese Bilder an und schreibt auf, welche Zeichen darauf zu erkennen sind. Danach lässt sich das Dokument durchsuchen und der Text herauskopieren.

Eine wichtige Einschränkung vorweg: Zur Auswahl stehen Koreanisch mit Englisch, Englisch allein, Koreanisch allein, Japanisch mit Englisch sowie vereinfachtes Chinesisch mit Englisch, Deutsch ist nicht darunter. Deutschsprachige Vorlagen mit Umlauten, ß und deutschen Eigennamen werden deshalb nicht zuverlässig erfasst, das Ergebnis ist für solche Dokumente meist nicht brauchbar. Wo die Sprache passt, hängt alles an der Vorlage: etwa 300 dpi, gerade eingelegt, gleichmäßig ausgeleuchtet und mit klarem Kontrast. Abfotografierte Seiten mit Schatten, Wölbung und schräger Perspektive liefern deutlich schlechtere Ergebnisse als ein echter Flachbettscan, und Handschrift wird gar nicht gelesen.

Als Ausgabe erhalten Sie entweder reinen Text oder eine durchsuchbare PDF, bei der das Seitenbild unverändert sichtbar bleibt und die erkannten Zeichen unsichtbar darunterliegen; das Dokument sieht also aus wie vorher, reagiert aber auf die Suche. Enthält die Datei bereits echten Text, ist die einfache Textausgabe genauer, schneller und fehlerfrei. Die Erkennung läuft vollständig im Browser auf Ihrem Gerät, das Dokument wird nicht an einen Cloud-Dienst zur Auswertung geschickt, was bei Ausweisen, Verträgen und Patientenunterlagen den Unterschied macht.

So funktioniert es

  1. 1

    Wählen Sie ein gescanntes PDF aus.

  2. 2

    Prüfen Sie die Sprachen und klicken Sie auf Starten.

  3. 3

    Laden Sie das durchsuchbare PDF und die .txt herunter.

Häufige Fragen

Wie lange dauert es?
Etwa 3–10 Sekunden pro Seite. Beim ersten Durchlauf werden ~4 MB Sprachdaten heruntergeladen.
Genauigkeit?
Hoch bei sauberen Drucken, niedriger bei unscharfen Scans oder Handschrift. Tabellenstruktur wird nicht erkannt.

Verwandte Tools