OCR PDF

Den Text aus einem gescannten PDF lesen — kopieren oder als .txt-Datei speichern.

100 % privat – läuft vollständig in Ihrem Browser. Ihre Daten werden auf Ihrem Gerät verarbeitet und niemals ins Internet gesendet.

Klicken zum Hochladen oder ein gescanntes PDF hierher ziehen

Ein PDF — per OCR auf Ihrem Gerät gelesen, nie hochgeladen

Über OCR für PDFs

Manche PDFs enthalten überhaupt keinen Text. Ein gescannter Vertrag, ein fotografierter Kassenbon, ein Fax, ein altes Buch aus dem Bibliotheksscanner — jede Seite ist nur ein Bild von Text. Sie können es lesen, aber nicht markieren, nicht kopieren und nicht durchsuchen.

OCR (optische Zeichenerkennung) löst das. Sie sieht sich das Bild jeder Seite an, erkennt die Formen der Buchstaben und gibt Ihnen echten Text zurück, den Sie kopieren, bearbeiten und durchsuchen können.

Dieses Werkzeug arbeitet Seite für Seite und zeigt den Text, sobald eine Seite fertig ist. Sie müssen also nicht auf das ganze Dokument warten, bevor Sie loslegen.

Alles passiert auf Ihrem Gerät

Gescannte PDFs sind oft die privaten: ein Ausweis, ein Brief von der Bank, ein ärztliches Formular, ein unterschriebener Vertrag. Die meisten Online-OCR-Dienste wollen, dass Sie sie hochladen.

Dieser nicht. Die OCR-Engine (Tesseract, die Open-Source-Engine hinter vielen professionellen Programmen) läuft in Ihrem Browser:

  • Privat — das PDF verlässt nie Ihr Gerät
  • Keine Anmeldung, kein Seitenlimit, kein Wasserzeichen

Beim ersten Mal werden die Engine und die Sprachdaten geladen — ein paar Megabyte. Ihr Browser behält sie, der nächste Start geht also schneller.

Textseiten und gescannte Seiten in einer Datei

Viele PDFs sind gemischt. Getippte Seiten mit einer gescannten Unterschriftsseite am Ende. Ein Scan, über den schon einmal OCR gelaufen ist. Ein Bericht mit ein paar fotografierten Seiten in der Mitte.

Standardmäßig prüft das Werkzeug zuerst jede Seite:

  • Eine Seite, die schon echten Text hat, wird direkt übernommen — exakt, sofort, ohne OCR-Fehler
  • Eine Seite, die nur ein Bild ist, wird per OCR gelesen

Am Ende sehen Sie, wie viele Seiten welchen Weg gegangen sind. Nehmen Sie den Haken bei „Seiten mit echtem Text" heraus, um OCR auf jeder Seite zu erzwingen — praktisch, wenn die alte Textebene falsch oder verstümmelt ist.

So wird das Ergebnis am besten

OCR ist sehr gut, aber es liest ein Bild — also kommt es auf das Bild an:

  • Wählen Sie die richtige Sprache. Sie bestimmt, welche Buchstaben und Akzente die Engine erwartet. Deutscher Text, als Englisch gelesen, verliert seine ä, ö, ü und ß.
  • Gerade, scharfe Seiten lesen sich am besten. Ein schiefes Handyfoto oder ein unscharfes Fax bringt mehr Fehler.
  • Normaler gedruckter Text klappt gut. Handschrift, sehr kleine Schrift und Zierschriften klappen schlecht.
  • Tabellen kommen als Textzeilen heraus, nicht als Tabelle. Prüfen Sie bei einer Tabelle danach die Spalten.
  • Lesen Sie das Ergebnis immer, bevor Sie sich darauf verlassen. Achten Sie auf 1 / l / I, 0 / O und rn / m — die klassischen OCR-Verwechslungen.

Wofür Leute es benutzen

  • Einen Absatz aus einem gescannten Vertrag oder einem Brief kopieren
  • Den Text eines alten Buchs oder Artikels holen, den es nur als Scan gibt
  • Einen Kassenbon oder eine Rechnung als Scan in den eigenen Notizen durchsuchbar machen
  • Zitate aus gescannten Fachartikeln und Handouts holen
  • Formulare und Unterlagen erfassen, ohne sie von Hand abzutippen
  • Ein gefaxtes Dokument in etwas Bearbeitbares verwandeln

Gut zu wissen

  • Ein passwortgeschütztes PDF muss zuerst entsperrt werden — dafür gibt es PDF entsperren
  • Große Dokumente brauchen Zeit: etwa 2–10 Sekunden pro Seite am Computer, länger am Handy. Lesen Sie mit Seiten nur den Teil, den Sie brauchen
  • Stopp behält jede Seite, die schon gelesen ist
  • Das Ergebnis ist reiner Text. Um ihn in Word zu bekommen, fügen Sie ihn ein — oder nehmen Sie PDF in Word für PDFs, die schon Text haben
  • Hat Ihr PDF auf jeder Seite echten Text, ist PDF in Text schneller und hat mehr Layout-Optionen

Häufige Fragen

Ist es kostenlos?

Ja. Keine Anmeldung, kein Seitenlimit, kein Wasserzeichen.

Wird mein PDF hochgeladen?

Nein. Die Seiten werden in dieser Seite gezeichnet und gelesen, auf Ihrem eigenen Gerät.

Welche Sprachen liest es?

Englisch, Spanisch, Französisch, Deutsch, Italienisch, Portugiesisch, Niederländisch, Chinesisch (vereinfacht), Japanisch und Koreanisch. Wählen Sie eine, bevor Sie starten.

Warum sind Fehler im Text?

OCR rät jeden Buchstaben anhand seiner Form. Ein unscharfer, schiefer oder niedrig aufgelöster Scan lässt es öfter falsch raten. Prüfen Sie das Ergebnis und korrigieren Sie die paar Fehler im Feld, bevor Sie es kopieren.

Kann es mein PDF durchsuchbar machen?

Noch nicht — es gibt Ihnen den Text als eigene .txt-Datei. Ihr ursprüngliches PDF bleibt unverändert.

So wird es benutzt

  • Auf Klicken zum Hochladen klicken oder das gescannte PDF auf das Feld ziehen
  • Die Sprache des Textes wählen
  • Einen Seitenbereich eintippen, wenn Sie nur einige Seiten brauchen — oder leer lassen für alle
  • Auf Text lesen klicken und zusehen, wie die Seiten hereinkommen
  • Den Text prüfen, dann auf Kopieren oder .txt herunterladen klicken

Verwandte Werkzeuge

Wir veröffentlichen regelmäßig neue Tools — abonniere uns auf YouTube, um bei jedem neuen Tool benachrichtigt zu werden.

Weitere Tools

Alle anzeigen

Empfohlene Apps

Alle anzeigen