Klicken zum Hochladen oder ein gescanntes PDF hierher ziehen
Ein PDF — per OCR auf Ihrem Gerät gelesen, nie hochgeladenÜber OCR für PDFs
Manche PDFs enthalten überhaupt keinen Text. Ein gescannter Vertrag, ein fotografierter Kassenbon, ein Fax, ein altes Buch aus dem Bibliotheksscanner — jede Seite ist nur ein Bild von Text. Sie können es lesen, aber nicht markieren, nicht kopieren und nicht durchsuchen.
OCR (optische Zeichenerkennung) löst das. Sie sieht sich das Bild jeder Seite an, erkennt die Formen der Buchstaben und gibt Ihnen echten Text zurück, den Sie kopieren, bearbeiten und durchsuchen können.
Dieses Werkzeug arbeitet Seite für Seite und zeigt den Text, sobald eine Seite fertig ist. Sie müssen also nicht auf das ganze Dokument warten, bevor Sie loslegen.
Alles passiert auf Ihrem Gerät
Gescannte PDFs sind oft die privaten: ein Ausweis, ein Brief von der Bank, ein ärztliches Formular, ein unterschriebener Vertrag. Die meisten Online-OCR-Dienste wollen, dass Sie sie hochladen.
Dieser nicht. Die OCR-Engine (Tesseract, die Open-Source-Engine hinter vielen professionellen Programmen) läuft in Ihrem Browser:
- Privat — das PDF verlässt nie Ihr Gerät
- Keine Anmeldung, kein Seitenlimit, kein Wasserzeichen
Beim ersten Mal werden die Engine und die Sprachdaten geladen — ein paar Megabyte. Ihr Browser behält sie, der nächste Start geht also schneller.
Textseiten und gescannte Seiten in einer Datei
Viele PDFs sind gemischt. Getippte Seiten mit einer gescannten Unterschriftsseite am Ende. Ein Scan, über den schon einmal OCR gelaufen ist. Ein Bericht mit ein paar fotografierten Seiten in der Mitte.
Standardmäßig prüft das Werkzeug zuerst jede Seite:
- Eine Seite, die schon echten Text hat, wird direkt übernommen — exakt, sofort, ohne OCR-Fehler
- Eine Seite, die nur ein Bild ist, wird per OCR gelesen
Am Ende sehen Sie, wie viele Seiten welchen Weg gegangen sind. Nehmen Sie den Haken bei „Seiten mit echtem Text" heraus, um OCR auf jeder Seite zu erzwingen — praktisch, wenn die alte Textebene falsch oder verstümmelt ist.
So wird das Ergebnis am besten
OCR ist sehr gut, aber es liest ein Bild — also kommt es auf das Bild an:
- Wählen Sie die richtige Sprache. Sie bestimmt, welche Buchstaben und Akzente die Engine erwartet. Deutscher Text, als Englisch gelesen, verliert seine ä, ö, ü und ß.
- Gerade, scharfe Seiten lesen sich am besten. Ein schiefes Handyfoto oder ein unscharfes Fax bringt mehr Fehler.
- Normaler gedruckter Text klappt gut. Handschrift, sehr kleine Schrift und Zierschriften klappen schlecht.
- Tabellen kommen als Textzeilen heraus, nicht als Tabelle. Prüfen Sie bei einer Tabelle danach die Spalten.
- Lesen Sie das Ergebnis immer, bevor Sie sich darauf verlassen. Achten Sie auf 1 / l / I, 0 / O und rn / m — die klassischen OCR-Verwechslungen.
Wofür Leute es benutzen
- Einen Absatz aus einem gescannten Vertrag oder einem Brief kopieren
- Den Text eines alten Buchs oder Artikels holen, den es nur als Scan gibt
- Einen Kassenbon oder eine Rechnung als Scan in den eigenen Notizen durchsuchbar machen
- Zitate aus gescannten Fachartikeln und Handouts holen
- Formulare und Unterlagen erfassen, ohne sie von Hand abzutippen
- Ein gefaxtes Dokument in etwas Bearbeitbares verwandeln
Gut zu wissen
- Ein passwortgeschütztes PDF muss zuerst entsperrt werden — dafür gibt es PDF entsperren
- Große Dokumente brauchen Zeit: etwa 2–10 Sekunden pro Seite am Computer, länger am Handy. Lesen Sie mit Seiten nur den Teil, den Sie brauchen
- Stopp behält jede Seite, die schon gelesen ist
- Das Ergebnis ist reiner Text. Um ihn in Word zu bekommen, fügen Sie ihn ein — oder nehmen Sie PDF in Word für PDFs, die schon Text haben
- Hat Ihr PDF auf jeder Seite echten Text, ist PDF in Text schneller und hat mehr Layout-Optionen
Häufige Fragen
Ist es kostenlos?
Ja. Keine Anmeldung, kein Seitenlimit, kein Wasserzeichen.
Wird mein PDF hochgeladen?
Nein. Die Seiten werden in dieser Seite gezeichnet und gelesen, auf Ihrem eigenen Gerät.
Welche Sprachen liest es?
Englisch, Spanisch, Französisch, Deutsch, Italienisch, Portugiesisch, Niederländisch, Chinesisch (vereinfacht), Japanisch und Koreanisch. Wählen Sie eine, bevor Sie starten.
Warum sind Fehler im Text?
OCR rät jeden Buchstaben anhand seiner Form. Ein unscharfer, schiefer oder niedrig aufgelöster Scan lässt es öfter falsch raten. Prüfen Sie das Ergebnis und korrigieren Sie die paar Fehler im Feld, bevor Sie es kopieren.
Kann es mein PDF durchsuchbar machen?
Noch nicht — es gibt Ihnen den Text als eigene .txt-Datei. Ihr ursprüngliches PDF bleibt unverändert.
So wird es benutzt
- Auf Klicken zum Hochladen klicken oder das gescannte PDF auf das Feld ziehen
- Die Sprache des Textes wählen
- Einen Seitenbereich eintippen, wenn Sie nur einige Seiten brauchen — oder leer lassen für alle
- Auf Text lesen klicken und zusehen, wie die Seiten hereinkommen
- Den Text prüfen, dann auf Kopieren oder .txt herunterladen klicken
Verwandte Werkzeuge
- PDF in Text — für PDFs, die schon echten Text enthalten
- Bild in Text — dieselbe OCR für ein Foto oder einen Screenshot
- PDF in Word — ein Text-PDF in ein bearbeitbares Dokument verwandeln
- PDF in JPG — die gescannten Seiten als Bilder speichern
- PDF komprimieren — einen schweren Scan verkleinern
- PDF entsperren — vor dem Lesen ein Passwort entfernen