PDF in Text umwandeln
Die Textebene eines PDFs in eine .txt-Datei extrahieren. Gescannte (reine Bild-)PDFs liefern keinen Text.
Dieses Tool lädt Ihre Dateien nicht hoch. Schließen Sie den Tab, und nichts bleibt zurück.
Dateien hierher ziehen oder
Dateien auswählenUnterstützt: PDF · oder mit Strg+V einfügen
Nur der Wortlaut, ohne alles andere
In einem zweihundertseitigen Gutachten soll eine Formulierung gefunden und zitiert werden. Der Text einer Norm soll in ein Übersetzungswerkzeug, in eine Auswertung oder einfach in den Editor, ohne dass Kopf- und Fußzeilen mitwandern. Die Textausgabe zieht genau das heraus, was als Zeichen in der Datei gespeichert ist, und legt es als .txt in UTF-8 ab, sodass Umlaute und das scharfe S korrekt ankommen.
Die Lesereihenfolge folgt der Reihenfolge, in der die Zeichen in der Datei stehen, und die entspricht nicht immer dem, was das Auge sieht. Bei zweispaltigem Satz, Seitenzahlen, Marginalien und Tabellen kann sich der Ablauf vermischen; Tabellenzellen erscheinen als aufeinanderfolgende Zeilen, ihre Zuordnung zu Spalten geht verloren. Formatierung, Bilder und Seitenaufteilung werden bewusst nicht übernommen. Kommt ausschließlich Buchstabensalat heraus, fehlt der Datei die Zuordnung ihrer Schriftzeichen zu Unicode, was bei manchen älteren Satzprogrammen vorkommt und sich nicht nachträglich reparieren lässt.
Eine eingescannte PDF ergibt eine leere Datei, und das ist kein Fehler: Auf einem Scan gibt es keine Zeichen, nur ein Bild der Seite. Für solche Dokumente ist die Texterkennung zuständig, in deren Sprachauswahl Deutsch allerdings nicht enthalten ist. Wer den Wortlaut lieber gleich in Absätzen in einem bearbeitbaren Dokument hätte, nimmt die Word-Ausgabe, die allerdings ebenfalls nur Text liefert. Gelesen wird die Datei lokal im Browser, ein Upload findet nicht statt.
So funktioniert es
- 1
Wählen Sie ein PDF aus.
- 2
Legen Sie optional einen Seitenbereich fest.
- 3
Klicken Sie auf Starten und laden Sie das Ergebnis herunter.
Häufige Fragen
- Das Ergebnis ist leer.
- Gescannte PDFs haben keine Textebene. Nutzen Sie dafür das KI-Konvertierungstool.
- Die Zeilenumbrüche sehen seltsam aus.
- PDFs speichern keine Zeilenstruktur; sie wird aus Positionen abgeleitet. Mehrspaltige Layouts können sich vermischen.