PDF-Textextraktion
Für das ganze Dokument leer lassen oder 1-5, 8 für bestimmte Seiten schreiben.
Die Datei wird in dieser Seite geöffnet und gelesen. Sie wird nie hochgeladen, also gibt es hinterher nichts, was auf einem Server gespeichert oder gelöscht würde.
Was diese Extraktion leistet
Eine PDF-Seite ist eine Liste von Zeichenanweisungen, und die Wörter darauf sind meist echte Textobjekte, kein Bild. Diese Seite liest genau diese Objekte, Sie erhalten also durchsuchbare, zitierbare und bearbeitbare Zeichen — ohne dass die Datei Ihren Rechner verlässt.
So funktioniert es
- 1 Ziehen Sie die PDF auf das Feld oder klicken Sie darauf und wählen Sie die Datei.
- 2 Legen Sie den Seitenbereich fest, wenn Sie nur einen Teil brauchen, und wählen Sie, ob Zeilenumbrüche bleiben sollen.
- 3 Klicken Sie auf Text extrahieren und kopieren Sie das Ergebnis oder laden Sie es als .txt herunter.
Extraktion ist nicht dasselbe wie OCR
Stammt die PDF aus einer Textverarbeitung oder einem Rechnungssystem, stecken die Zeichen bereits darin und das Auslesen ist exakt. Kommt sie von einem Scanner oder einer Handykamera, ist die Seite nur ein Foto und es gibt nichts auszulesen; diese Buchstaben zu erkennen ist optische Zeichenerkennung, eine andere und weit unzuverlässigere Aufgabe. Dieses Werkzeug sagt Ihnen, welcher Fall vorliegt, statt ein leeres Feld zurückzugeben.
Woher die Zeilenumbrüche kommen
Eine PDF speichert weder Zeilen noch Absätze, nur Text an Koordinaten. Der Leser fasst Stücke auf gleicher Höhe zu einer Zeile zusammen und beginnt eine neue, wenn sich die Höhe ändert. Bei gewöhnlichen Dokumenten klappt das gut, bei mehrspaltigen Layouts unvollkommen: die beiden Spalten einer Seite können sich verschränken.
Seiten auswählen
Das Bereichsfeld nimmt einzelne Seiten und Bereiche, durch Kommas getrennt. Wiederholungen entfallen und die Seiten werden der Reihe nach gelesen, unsortierte Eingabe schadet also nicht. Eine Zahl außerhalb des Bereichs wird abgelehnt statt stillschweigend übergangen, denn eine still übersprungene Seite bedeutet fehlenden Text, den Sie nie bemerken.
1-5 → 1, 2, 3, 4, 5 2, 7, 9 → 2, 7, 9 1-3, 10 → 1, 2, 3, 10 (bos) → alle Seiten
Eine Anmerkung zur Formatierung
Die Ausgabe ist reiner Text, also überleben Fettdruck, Überschriften, Tabellen und Bilder nicht; eine Tabelle wird zu Wortzeilen ohne Zellgrenzen. Wenn das Layout erhalten bleiben soll, ist die Umwandlung in ein Dokumentformat das richtige Werkzeug, und wenn Sie die Seiten nur als Bilder brauchen, tun das die Seiten PDF zu JPG und PDF zu PNG.