Klicken zum Hochladen oder PDF hierher ziehen
Ein PDF — in Ihrem Browser gelesen, nie hochgeladenÜber das Herausholen von Text aus einem PDF
Ein PDF, das aus einem Dokument entstanden ist, enthält seinen Text bereits. Die Buchstaben stehen in der Datei; der Reader zeichnet sie nur an der richtigen Stelle auf die Seite.
Sie herauszubekommen sollte einfach sein und ist es meistens nicht. „Alles markieren" in einem Reader gibt Ihnen Kopfzeilen, Fußzeilen und Seitenzahlen mitten in den Sätzen. Kopieren Sie eine Tabelle, kommt sie als eine lange Zeile an. Kopieren Sie zwei Spalten, verschränken sie sich. Und auf dem Handy lässt sich oft gar nichts markieren.
Dieses Werkzeug fragt das PDF direkt nach seinem Text und gibt Ihnen das Ergebnis in einem Feld, das Sie bearbeiten, kopieren oder als .txt herunterladen können.
Es liest, es rät nicht
Das ist kein OCR. OCR sieht sich ein Bild einer Seite an und versucht, die Formen als Buchstaben zu erkennen — nützlich, aber fehleranfällig, und 1, l und I sind ein lebenslanges Thema.
Hier gibt es nichts zu erkennen. Die Zeichen stehen bereits im PDF und kommen genau so heraus, wie sie hineingekommen sind. Keine falsch gelesenen Buchstaben, kein Vertrauenswert und kein Warten: ein Bericht mit 200 Seiten ist in ein paar Sekunden fertig.
Das Einzige, was es nicht kann, ist einen Scan lesen. Eine gescannte Seite ist ein Foto, in dem gar kein Text steckt. Passiert das, sagt das Werkzeug es deutlich, statt Ihnen ein leeres Feld zu geben — und weist Ihnen den Weg über OCR.
Die Seiten wählen
Lassen Sie das Feld Seiten leer, um das ganze Dokument zu nehmen, oder benennen Sie, was Sie wollen:
- 5 — nur Seite 5
- 1-3 — die ersten drei Seiten
- 1-3, 5, 8-10 — Bereiche und einzelne Seiten gemischt
Nützlich, wenn Sie nur ein Kapitel eines langen Berichts brauchen, oder wenn die ersten beiden Seiten ein Deckblatt und ein Inhaltsverzeichnis sind, das Sie nicht wollen.
Zeilenumbrüche: behalten oder zusammenführen
Ein PDF speichert, wo jede Zeile gezeichnet wurde, nicht wo ein Satz endet. Ein Absatz kommt daher als fünf einzelne Zeilen an, die nur umbrochen wurden, weil die Seite zu Ende war.
- Zeilen so lassen, wie sie sind — genau wie auf der Seite gesetzt. Richtig für Tabellen, Adressen, Gedichte, Code, Listen und alles, wo die Zeile *die* Bedeutung trägt.
- Zeilen zu Absätzen zusammenführen — setzt einen zerrissenen Satz wieder zu einer Zeile zusammen. Richtig für Fließtext, den Sie in ein Dokument, eine E-Mail oder einen Übersetzer einfügen.
Das Zusammenführen ist vorsichtig: eine Zeile, die einen Satz beendet, eine Überschrift, ein Aufzählungspunkt und ein nummerierter Eintrag behalten alle ihren Umbruch. Nur eine Zeile, die klar mitten im Satz aufhört, wird an die nächste gehängt.
Seitenmarkierungen
Seitenanfänge markieren setzt eine Zeile --- Seite 7 --- zwischen die Seiten. Lassen Sie das an, wenn Sie den Weg zurück ins Original finden müssen — einen Bericht zitieren, einen Vertrag prüfen, eine Quelle belegen. Schalten Sie es aus, wenn Sie sauberen Fließtext zum Einfügen wollen.
Nichts verlässt Ihr Gerät
Das PDF wird in Ihrem Browser geöffnet und gelesen. Es wird nicht hochgeladen, nicht eingereiht und nicht gespeichert. Das zählt bei den Dokumenten, für die man das wirklich braucht: Verträge, Kontoauszüge, Arztbriefe, Schriftsätze, alles unter einer Verschwiegenheitsvereinbarung.
Es heißt auch, dass es keine Größenbeschränkung durch einen Upload gibt und dass es offline funktioniert, sobald die Seite geladen ist.
Wofür Leute es benutzen
- Ein Zitat aus einem Bericht holen, ohne es abzutippen
- Ein Dokument in einen Übersetzer, eine Zusammenfassung oder eine Suche geben
- Ein Handbuch oder eine Richtlinie in reinen Text verwandeln, um mit Strg+F zu suchen
- Fließtext aus einem Buch oder einer Arbeit holen, um ihn zu bearbeiten oder zu lernen
- Text in eine Textverarbeitung bringen, wenn Kopieren aus dem Reader zerschossen ankommt
- Inhalte für eine Website aus einer PDF-Broschüre ziehen
- Ein Dokument für einen Screenreader lesbar machen, der mit dem PDF Mühe hat
Gut zu wissen
- Ein passwortgeschütztes PDF muss zuerst entsperrt werden — dafür gibt es PDF entsperren
- Ein PDF, das ein Scan ist, hat keinen Text; nehmen Sie PDF in JPG und dann Bild zu Text
- Spalten, Tabellen und Fußnoten kommen in der Reihenfolge, in der das PDF sie speichert — meist, aber nicht immer die Reihenfolge, in der Sie sie lesen. Prüfen Sie das Ergebnis
- Das Textfeld ist bearbeitbar, Sie können das Ergebnis also vor dem Herunterladen aufräumen
- Der Download ist eine einfache .txt-Datei in UTF-8, Umlaute und nicht-lateinische Zeichen überleben also
- Formatierung — fett, Größe, Farbe, Bilder — bleibt nicht erhalten. Reiner Text ist der Sinn der Sache. Für ein formatiertes Dokument gibt es PDF in Word
So wird es benutzt
- Auf Klicken zum Hochladen klicken oder das PDF auf das Feld ziehen
- Seiten für das ganze Dokument leer lassen, oder die gewünschten Seiten eintippen
- Zeilen so lassen, wie sie sind für Tabellen und Listen wählen, oder Zeilen zu Absätzen zusammenführen für Fließtext
- Seitenanfänge markieren an- oder abhaken
- Auf Text extrahieren drücken, das Ergebnis lesen, dann Kopieren oder .txt herunterladen
Verwandte Werkzeuge
- PDF in Word — wenn Sie die Formatierung brauchen, nicht nur die Wörter
- Bild zu Text — OCR, für Scans und Screenshots
- PDF in JPG — gescannte Seiten in Bilder verwandeln, um sie durch OCR zu schicken
- PDF entsperren — zuerst ein Passwort entfernen
- Text in Dateien finden — einen ganzen Ordner auf einmal durchsuchen
- Wörter zählen — zählen, was Sie extrahiert haben
- PDF teilen — einen Seitenbereich als eigenes PDF herausholen