Mittelstufe 12 Min.Vision

Tesseract OCR: einen Scan lokal lesen (Anleitung französisch)

Direkte Antwort

Tesseract ist die maßgebliche freie OCR-Engine (Apache 2.0, über 70.000 Sterne auf GitHub, Version 5.5.3 im Jahr 2026): kostenlos, offline nutzbar und überall verfügbar. Ihre Genauigkeit hängt weit stärker von der Bildqualität – Auflösung, Ausrichtung, Kontrast – ab als von ihren eigenen Einstellungen. Bei sauberem Text bleibt sie schnell und zuverlässig; bei einem komplexen Layout oder einem leicht schiefen Dokument kann ihre Genauigkeit schlagartig einbrechen.

Ein gescanntes PDF enthält keinen Text: Es ist ein Bild von Text. Solange es nicht durch optische Zeichenerkennung verarbeitet wurde, wird es ohne Textinhalt indexiert, und der Dokumentenassistent behauptet steif und fest, das Dokument sage nichts aus. Tesseract ist die maßgebliche freie OCR-Engine für diesen Schritt: kostenlos, offline, überall verfügbar und weit stärker von der Bildqualität abhängig als von den eigenen Einstellungen.

Von Mohamed Meguedmi·Aktualisierung 2026-09-29·Unter Windows, macOS und Linux getestet

#Was Tesseract ist und was es nicht ist

Tesseract ist eine Engine für die optische Zeichenerkennung, die unter der Apache-2.0-Lizenz veröffentlicht wird. Das offizielle Repository, das von seinen Maintainern als „Tesseract Open Source OCR Engine“ beschrieben wird, hat auf GitHub heute über 70.000 Sterne. Mit Version 4 kam eine auf neuronalen LSTM-Netzen basierende Engine hinzu, deren Schwerpunkt auf der Erkennung von Textzeilen liegt; die ursprüngliche Engine, die Zeichenmuster erkennt, bleibt optional verfügbar. Tesseract liest gängige Bildformate (PNG, JPEG, TIFF) und erzeugt Klartext, hOCR, PDF oder TSV. Die bisher neueste stabile Version, 5.5.3, erschien am 24. Juli 2026. In der Praxis: Installieren Sie die Sprachdatei, achten Sie auf die Bildqualität (300 Punkte pro Zoll, gerade ausgerichtete Seite, deutlicher Kontrast), wählen Sie den richtigen Segmentierungsmodus und überprüfen Sie das Ergebnis anhand von etwa zwanzig Seiten, bevor Sie eine Stapelverarbeitung starten.

Was es nicht ist: ein Werkzeug zum Verstehen von Dokumenten. Es gibt Text aus, gegebenenfalls mit Positionsangaben. Es erkennt einen Textblock nicht als Überschrift, rekonstruiert eine Tabelle nicht in Zeilen und Spalten und versteht nicht, was es liest. Bei einem strukturierten Dokument ist OCR nur einer von mehreren Bausteinen.

#Französisch: die Sprachdatei

Das Kit Lokale KI

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Standardmäßig erkennt Tesseract englischen Text. Bei einem französischen Dokument führt das zu verlorenen Akzenten und ungenau erkannten Wörtern — und viele schließen daraus, dass die OCR-Engine schlecht sei. Die Dokumentation stellt klar, dass ohne die Option -l Englisch angenommen wird. Daher muss die Datendatei für die jeweilige Sprache installiert und die Sprache beim Ausführen ausdrücklich angegeben werden. Nach Angaben des Projekts können mit den richtigen installierten Paketen mehr als hundert Sprachen erkannt werden.

Texterkennung in einem französischsprachigen Scan
# Debian/Ubuntu : installer les données françaises
sudo apt install tesseract-ocr tesseract-ocr-fra

# macOS (Homebrew) : le moteur puis les langues supplémentaires
brew install tesseract tesseract-lang

# Reconnaître une image en français, sortie texte
tesseract scan.png sortie -l fra

# Plusieurs langues dans le même document
tesseract scan.png sortie -l fra+eng

# Sortie PDF avec couche de texte interrogeable
tesseract scan.png sortie -l fra pdf
i
Ein PDF ist keine Bilddatei
Tesseract erwartet Bilder als Eingabe. Bei einem Bild erzeugt das Anhängen von pdf an das Ende des Befehls eine PDF-Datei mit einer durchsuchbaren Textebene. Bei einer mehrseitigen gescannten PDF-Datei rastert ein auf Tesseract basierendes Tool wie OCRmyPDF die Seiten und fügt dem Dokument anschließend die Textebene hinzu.

#Die Bildqualität ist entscheidend

Diesen Punkt entdeckt man oft zu spät: Die offizielle Dokumentation widmet ihre Seite „Improve quality“ der Bildverarbeitung, bevor sie auf die Einstellungen der OCR-Engine eingeht. Tesseract führt bereits interne Verarbeitungsschritte durch (Bibliothek Leptonica), doch diese reichen nicht immer aus, und eine Vorverarbeitung mit wenigen Codezeilen genügt oft, um einen schlechten Scan lesbar zu machen. Koncile, ein Anbieter von Software zur Rechnungsextraktion, zeigt das Ausmaß dieses Effekts in eigenen, 2026 veröffentlichten Tests: Bei einer Rechnung, die um lediglich drei bis fünf Grad geneigt ist, sinkt die Quote korrekt gelesener Inhalte von 100 % auf 31 %. Das ist keine unabhängige Studie, doch die Größenordnung entspricht der Warnung in der offiziellen Dokumentation. Keine Einstellung der OCR-Engine kann einen solchen Einbruch ausgleichen; das kann nur eine vorherige Begradigung.

Auflösung
Die offizielle Dokumentation weist darauf hin, dass Tesseract auf Bildern mit mindestens 300 Punkten pro Zoll besser funktioniert und empfiehlt, die Größe anzupassen, wenn dies nicht der Fall ist.
Begradigung
Die Dokumentation warnt davor, dass die Qualität der Zeilensegmentierung erheblich abnimmt, wenn die Seite zu schief ist: Die Bildaufnahme muss gedreht werden, damit die Zeilen horizontal sind. Siehe die Zahl oben.
Kontrast und Binarisierung
Tesseract binarisiert intern mit dem Otsu-Algorithmus, was bei einem ungleichmäßig gefärbten Hintergrund manchmal zu mäßigen Ergebnissen führt. Version 5.0 hat zwei Methoden hinzugefügt, Adaptive Otsu und Sauvola, die über die Parameter thresholding_* einstellbar sind. Ab Version 4 benötigt die Engine dunklen Text auf hellem Hintergrund.
Ränder
Sehr breite Ränder stören die OCR-Engine, zu knapp zugeschnittener Text aber ebenfalls: Die Dokumentation empfiehlt, um einen Ausschnitt ohne Rand einen kleinen weißen Rand hinzuzufügen (10 Pixel in ihrem Beispiel).
  1. 01
    Die Seite gerade ausrichten
    Den vorherrschenden Winkel des Textes erkennen und das Bild vor allen weiteren Schritten drehen; ein einfaches Skript auf Basis der Hough-Transformation reicht für die meisten Büroscanner aus.
  2. 02
    Kontrast verbessern
    In Graustufen umwandeln und anschließend binarisieren (mit adaptiver Schwellenwertbildung statt eines festen Schwellenwerts, der bei ungleichmäßiger Beleuchtung versagt), um reines Schwarz auf reinem Weiß zu erhalten.
  3. 03
    Zuschneiden und OCR starten
    Scanränder und große leere Ränder entfernen, einen schmalen weißen Rand um den Text lassen und anschließend Tesseract mit der zum Dokumenttyp passenden Sprache und dem passenden Segmentierungsmodus aufrufen.

#Die Einstellungen, die das Ergebnis verändern

Die Optionen, die Sie kennen sollten
OptionWas sie tutWann Sie die Option ändern sollten
Seitensegmentierungsmodus (--psm)Gibt der OCR-Engine an, wie die Seite aufgebaut ist: einzelner Block, Spalte, einzelne Zeile (7), verstreuter Text (11)Bei einem Beleg, einem Etikett, einer schmalen Spalte oder einem kleinen Bildausschnitt: Der Standardmodus erwartet eine ganze Seite
Engine-Modus (--oem)1: nur das neuronale LSTM-Netz; 0: die bisherige EngineSelten: Die Sprachdateien der gängigen Linux-Pakete (tessdata_fast) unterstützen nur LSTM, und die Modi 0 und 2 funktionieren mit ihnen nicht.
Liste der erlaubten Zeichen (tessedit_char_whitelist)Beschränkt die Erkennung auf eine Teilmenge von ZeichenBei einem rein numerischen Feld, um Verwechslungen zwischen Buchstaben und Ziffern zu verringern
Wörterbücher (load_system_dawg, load_freq_dawg)Zwei Variablen, die die Wortlisten der OCR-Engine aktivierenBei Belegen, Preislisten und Codes: Sie zu deaktivieren kann helfen, wenn der Großteil des Textes nicht aus geläufigen Wörtern besteht.

Der Segmentierungsmodus ist die Einstellung, die am häufigsten vergessen wird. Die Dokumentation weist darauf hin: Standardmäßig erwartet Tesseract eine Textseite, und zum Lesen eines kleinen Bereichs muss ein anderer Modus gewählt werden. Bei einem Bild mit nur einer Zeile behandelt Modus 7 diese als einzelne Zeile. Bei verstreutem Text ohne bestimmte Reihenfolge – etwa einem Screenshot mit verteilten Beschriftungen – vermeidet der entsprechende Modus dasselbe Problem. Der Engine-Modus hingegen verändert das Ergebnis selten, und zwar aus einem praktischen Grund: Die ältere Engine ist nur in den Sprachdateien des tessdata-Repositorys enthalten, nicht in den schnellen oder präzisen Varianten, die die meisten Distributionen mitliefern.

Bei sauberem, gut erfasstem Drucktext bleibt Tesseract konkurrenzfähig: FastOCR, ein Online-OCR-Dienst, der eine Cloud-Alternative verkauft, gibt für Tesseract v5 bei sauberem englischem Text eine Genauigkeit von 95 bis 97,2 % an, gegenüber 98,2 bis 99,1 % bei Google Cloud Vision. Diese Zahlen stammen von einem Anbieter mit eigenem wirtschaftlichem Interesse, der kein Testprotokoll veröffentlicht hat: Betrachten Sie sie als grobe Größenordnung, nicht als Messung. Die Wahl der OCR-Engine sollte sich nach der tatsächlichen Beschaffenheit der Dokumente richten: Bei sauberen, gedruckten Dokumenten reicht Tesseract völlig aus; bei beschädigten, handschriftlichen oder dicht strukturierten Dokumenten wird es zum schwächsten Glied der Kette.

#Tesseract oder ein Vision-Modell

Zwei Familien, zwei Anwendungsbereiche
KriteriumTesseractLokales Vision-Modell
RessourcenProzessor alleinGPU wünschenswert, mehrere Gigabyte
GeschwindigkeitSehr schnellErheblich langsamer
Sauberer Text in einer SpalteAusgezeichnetÄquivalent, teurer
Komplexe Formatierung, TabellenGering: Die Projektdokumentation weist auf ein bekanntes Problem mit Tabellen hinDeutlich besser
HandschriftSehr gering: 25 bis 40 % gemäß FastOCRErheblich besser
InhaltsverständnisKeineKann eine Frage zum Dokument beantworten
Risiko erfundener InhalteNiedrig: Er verwechselt Zeichen anstatt Werte zu bildenReal: Ein Modell kann einen plausiblen Wert halluzinieren

Diese letzte Zeile ist für jede Dokumentenprüfung wichtig: Tesseract macht Fehler, indem es Zeichen verwechselt, während ein Bildverarbeitungsmodell eine formal einwandfreie, aber falsche Zahl erzeugen kann. Der Unterschied ist nicht absolut, denn auch eine 0, die in einem Betrag als 8 gelesen wird, fällt nicht auf. Ein unsinniger Text verrät jedoch häufiger eine OCR-Engine als ein plausibler, erfundener Wert. Ein 2026 veröffentlichter Vergleich fasst die veränderte Landschaft zusammen: Die wirklichen Alternativen sind keine klassischen OCR-Engines mehr, sondern quelloffene Vision-Language-Modelle, wobei PaddleOCR-VL ausdrücklich genannt wird – allerdings mit einem zusätzlichen Aufwand, denn diese Modelle benötigen eine GPU, während Tesseract mit einem gewöhnlichen Prozessor auskommt.

#Die tatsächlichen Kosten eines Tesseract-Projekts

Die OCR-Engine selbst kostet nichts, was oft verschleiert, wofür bei einem OCR-Projekt tatsächlich Zeit aufgewendet wird. Die eigentliche Arbeit liegt in den Schritten rund um die Engine: Bildvorverarbeitung (Geraderichten, Binarisierung, Ränder) und Überprüfung des Ergebnisses. Eine realistische Budgetplanung sieht von Anfang an Zeit für diese beiden Schritte vor, statt sie erst nach einem ersten Stapel enttäuschender Ergebnisse zu entdecken.

Scanner oder Handyfoto
Ein Flachbettscanner liefert gerader ausgerichtete und besser ausgeleuchtete Seiten als eine freihändig aufgenommene Fotografie; den Scanner bevorzugen, sobald der Umfang dies rechtfertigt.
Ausgabeformat
Reiner Text reicht für die Indexierung aus; das hOCR-Format bewahrt die Positionen, was nützlich ist, um einen Auszug in der ursprünglichen Benutzeroberfläche hervorzuheben.
Qualitätskontrolle
Eine nach jedem Wechsel der Scanquelle von Hand überprüfte Stichprobe erkennt eine schleichende Abweichung, bevor sie den gesamten Stapel betrifft.
Volumen und Parallelisierung
Tesseract nutzt standardmäßig mehrere Threads (OpenMP), was für große Stapel nicht geeignet ist. Die Projekt-FAQ empfiehlt, mit der Variablen OMP_THREAD_LIMIT=1 einen Prozess pro Kern zu starten, wodurch der zusätzliche Aufwand des Multithreadings entfällt.

Ein letzter, oft vergessener Punkt: die Benennung der erzeugten Dateien. Bei mehreren Tausend Seiten muss sich nachvollziehen lassen, welcher Text zu welchem Scan gehört; denselben Basisnamen für das Bild und den erkannten Text beizubehalten, löst das Problem von Anfang an.

#In eine lokale Verarbeitungskette einbinden

In einem lokalen System zur Dokumentenverarbeitung kommt Tesseract nur an einer Stelle zum Einsatz: direkt vor der Indexierung, bei Dokumenten ohne Textebene. Der zu automatisierende Test ist einfach – liefert die Textextraktion aus einem PDF weniger als einige Dutzend Zeichen pro Seite (den Schwellenwert an Ihren Korpus anpassen), handelt es sich wahrscheinlich um einen Scan, der per OCR verarbeitet wird. Ohne diesen Test landen ganze Dokumente unbemerkt ohne Inhalt im Index, und niemand bemerkt es, bis sich ein Nutzer wundert.

Die Schräglagenkorrektur und die Binarisierung sollten in derselben Pipeline automatisiert werden, statt bei jeder Seite einzeln darüber zu entscheiden: Ein Skript, das den vorherrschenden Winkel erkennt und die Schräglage vor dem Aufruf der OCR-Engine korrigiert, vermeidet einen großen Teil der oben beschriebenen unangenehmen Überraschungen. Bei einem homogenen Stapel – immer derselbe Scanner, derselbe Dokumenttyp – wird diese Vorverarbeitung einmal eingestellt und läuft anschließend ohne Überwachung.

→
Vor dem Optimieren messen
Vor jeder Anpassung einen kleinen Satz von zwanzig bis dreißig Seiten zusammenstellen, die für den tatsächlichen Korpus repräsentativ sind, und die Fehlerquote vor und nach jeder Änderung notieren. Nur so lässt sich feststellen, ob das Geraderichten, die Binarisierung oder eine Änderung des Segmentierungsmodus bei Ihren Dokumenten tatsächlich geholfen hat und nicht nur bei einem einzelnen Beispiel.

#FAQ

Ist Tesseract kostenlos?+
Ja, es handelt sich um freie Software unter der Apache-2.0-Lizenz, die ohne Lizenzgebühren kommerziell genutzt werden kann und offline ohne Kosten pro Seite oder API-Schlüssel funktioniert. Das offizielle Repository hat über 70.000 Sterne auf GitHub – ein Zeichen für eine große Nutzerbasis und ein Projekt, das auch 2026 weiterhin aktiv gepflegt wird und dessen stabile Version im Juli veröffentlicht wurde.
Wie bringt man es dazu, französischen Text zu erkennen?+
Indem Sie die Datendatei für die französische Sprache installieren und Französisch beim Aufruf mit der Option -l fra ausdrücklich angeben. Andernfalls liest die Engine auf Englisch und erkennt Akzentzeichen völlig falsch, sodass aus einem „é“ ein nur ungefähr passendes Zeichen wird. Sie können mehrere Sprachen gleichzeitig kombinieren, zum Beispiel fra+eng für ein zweisprachiges Dokument.
Warum ist mein Ergebnis unleserlich?+
Meist liegt es an der Bildqualität: zu geringe Auflösung, schiefe Seite, schwacher Kontrast. Ein um nur drei bis fünf Grad geneigtes Dokument kann in den Tests des Softwareanbieters Koncile die Erkennungsrate von 100 % auf etwa 31 % senken. Das Bild gerade auszurichten, zu binarisieren und eine Auflösung von 300 Punkten pro Zoll anzustreben, bringt in der Regel mehr als Anpassungen an den Einstellungen der OCR-Engine.
Kann Tesseract Tabellen lesen?+
Es gibt den Text aus, nicht die Struktur, und die offizielle Dokumentation nennt ein bekanntes Problem mit Tabellen ohne benutzerdefinierte Segmentierung. Zeilen und Spalten gehen verloren, und ein Betrag kann der falschen Bezeichnung zugeordnet werden. Für Tabellen benötigt man ein Werkzeug zur Layoutanalyse wie PaddleOCR oder ein Vision-Modell, das die Zellen rekonstruieren kann, bevor man den extrahierten Zahlen vertraut.
Sollte ein Vision-Modell bevorzugt werden?+
Bei komplexen Layouts oder Handschrift ja: FastOCR, ein konkurrierender Dienst, gibt für Tesseract v5 bei Handschrift eine Genauigkeit zwischen 25 und 40 % an – eine Zahl, die mit Vorsicht zu betrachten ist. Bei sauberem gedrucktem Text bleibt Tesseract schneller und ressourcenschonender und erfindet weniger plausible Werte: Es verwechselt Zeichen, während ein Modell einen falschen, aber glaubwürdigen Wert erzeugen kann.
Was ist der Seitensegmentierungsmodus?+
Eine Einstellung, die der OCR-Engine vor dem Lesen die Struktur des Dokuments angibt: ganze Seite, einzelne Spalte, einzelne Zeile, einzelnes Wort oder verstreuter Text ohne bestimmte Reihenfolge. Dies ist die erste Einstellung, die Sie ändern sollten, wenn ein Bildausschnitt, der sichtbar Text enthält, kein Ergebnis liefert. Laut Dokumentation hilft es auch, einen schmalen weißen Rand um einen zu knapp zugeschnittenen Ausschnitt hinzuzufügen.
Wie macht man ein gescanntes PDF mit Tesseract durchsuchbar?+
Bei einem Bild fügen Sie pdf am Ende des Befehls hinzu: Tesseract erzeugt ein PDF mit einer verborgenen Textebene. Für ein mehrseitiges PDF verwenden Sie OCRmyPDF, das auf Tesseract basiert, die Seiten rasterisiert und anschließend diese Ebene zum Dokument hinzufügt. Geben Sie in beiden Fällen die Sprache mit -l fra an, sonst wird Englisch vorausgesetzt und die Akzente gehen verloren.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.