Dokumente umwandeln
PDF durchsuchbar machen (OCR)
Fügen Sie gescannten Seiten durchsuchbaren Text in über 100 Sprachen hinzu.
Datei auswählen
Wählen Sie ein gescanntes PDF mit bis zu 80 Seiten oder 120 MB.
Gescannte PDFs durchsuchbar machen
Texterkennung ergänzt einem Scan eine unsichtbare Textebene. Die Seite bleibt sichtbar wie zuvor, während Suche, Markieren und Kopieren möglich werden.
Text hinter dem Seitenbild
Ein Scan besteht zunächst aus Bildern. OCR erkennt die gedruckten Zeilen und legt den Text an der passenden Position hinter dem Seitenbild ab. Der sichtbare Scan bleibt erhalten. Danach können Sie nach Begriffen suchen, Text kopieren und das Dokument in einer Ablage indexieren. Die Textebene ist jedoch keine neue, frei bearbeitbare Seitengestaltung.
Seiten mit vorhandenem Text werden nicht erneut erkannt. Das ist besonders bei gemischten Dateien wichtig, in denen digitale Seiten und eingescannte Anlagen zusammenliegen. Die Zusammenfassung nennt, welche Seiten eine Textebene erhalten haben und welche bereits durchsuchbar waren.
Sprache und Vorlage richtig wählen
Die Erkennung arbeitet mit Tesseract im Browser. Sie können die Dokumentsprache automatisch bestimmen lassen oder eines von mehr als 100 Sprachpaketen wählen. Eine passende Sprache verbessert Umlaute, Worttrennung und Sonderzeichen. Für mehrsprachige oder ungewöhnliche Vorlagen lohnt sich eine ausdrückliche Auswahl.
Scharfer, aufrechter Druck mit gleichmäßiger Beleuchtung liefert die besten Ergebnisse. Unschärfe, Schatten, Handschrift, Stempel und dekorative Schriften bleiben fehleranfällig. Kontrollieren Sie deshalb Namen, Daten, Beträge und Aktenzeichen im kopierten Text gegen das Seitenbild.
Vorhandene Signaturen schützen
Das Ergänzen einer Textebene verändert die PDF-Datei und macht eine vorhandene digitale Signatur ungültig. Erkennt das Tool eine solche Signatur, hält es an. Bewahren Sie das signierte Original auf und arbeiten Sie nur mit einer dafür vorgesehenen unsignierten Kopie.
Enthält jede Seite bereits Text, bleibt die Ausgangsdatei die bessere Fassung. In diesem Fall ist keine weitere OCR nötig. So vermeiden Sie eine zusätzliche Datei ohne praktischen Nutzen.
Grenzen und Ausgabe
Ein Vorgang umfasst bis zu 80 Seiten und 120 MB. Längere Dokumente lassen sich in Abschnitten bearbeiten und anschließend wieder zusammenfügen. Nur das gewählte Sprachpaket wird aus dem Netz geladen; PDF und erkannter Text werden im Browser verarbeitet.
Öffnen Sie das Ergebnis nach dem Speichern in einem anderen PDF-Programm. Suchen Sie nach mehreren schwierigen Begriffen, markieren Sie Zeilen aus unterschiedlichen Seiten und prüfen Sie die Lesereihenfolge bei Spalten oder Tabellen. Behalten Sie den ursprünglichen Scan als Referenz.
Häufige Fragen
Was ist OCR und wann brauche ich es?
OCR liest die Schrift auf einer gescannten Seite und legt darüber eine unsichtbare Textebene, damit sich das PDF durchsuchen und kopieren lässt. Sie brauchen OCR, wenn sich Text in einem PDF nicht markieren oder finden lässt.
Welche Sprachen erkennt die PDF-Texterkennung?
Verfügbar sind mehr als 100 Sprachmodelle aus dem aktuellen Tesseract-Verzeichnis, darunter Türkisch, Arabisch, indische Schriften, Chinesisch, Japanisch, Koreanisch und historische Varianten.
Verändert die OCR das Aussehen meines PDFs?
Nein. OCR ergänzt unsichtbaren, durchsuchbaren Unicode-Text über den Originalseiten und rekonstruiert deren sichtbares Erscheinungsbild nicht.
Werden meine Seiten für die OCR hochgeladen?
Nein, keine Seite Ihres Dokuments wird hochgeladen. Heruntergeladen und zwischengespeichert wird nur das ausgewählte Erkennungspaket; danach läuft die OCR in diesem Browser.