Tesseract OCR: einen Scan lokal lesen (Anleitung französisch)
Tesseract ist die maßgebliche freie OCR-Engine (Apache 2.0, über 70.000 Sterne auf GitHub, Version 5.5.3 im Jahr 2026): kostenlos, offline nutzbar und überall verfügbar. Ihre Genauigkeit hängt weit stärker von der Bildqualität – Auflösung, Ausrichtung, Kontrast – ab als von ihren eigenen Einstellungen. Bei sauberem Text bleibt sie schnell und zuverlässig; bei einem komplexen Layout oder einem leicht schiefen Dokument kann ihre Genauigkeit schlagartig einbrechen.
Ein gescanntes PDF enthält keinen Text: Es ist ein Bild von Text. Solange es nicht durch optische Zeichenerkennung verarbeitet wurde, wird es ohne Textinhalt indexiert, und der Dokumentenassistent behauptet steif und fest, das Dokument sage nichts aus. Tesseract ist die maßgebliche freie OCR-Engine für diesen Schritt: kostenlos, offline, überall verfügbar und weit stärker von der Bildqualität abhängig als von den eigenen Einstellungen.
#Was Tesseract ist und was es nicht ist
Tesseract ist eine Engine für die optische Zeichenerkennung, die unter der Apache-2.0-Lizenz veröffentlicht wird. Das offizielle Repository, das von seinen Maintainern als „Tesseract Open Source OCR Engine“ beschrieben wird, hat auf GitHub heute über 70.000 Sterne. Mit Version 4 kam eine auf neuronalen LSTM-Netzen basierende Engine hinzu, deren Schwerpunkt auf der Erkennung von Textzeilen liegt; die ursprüngliche Engine, die Zeichenmuster erkennt, bleibt optional verfügbar. Tesseract liest gängige Bildformate (PNG, JPEG, TIFF) und erzeugt Klartext, hOCR, PDF oder TSV. Die bisher neueste stabile Version, 5.5.3, erschien am 24. Juli 2026. In der Praxis: Installieren Sie die Sprachdatei, achten Sie auf die Bildqualität (300 Punkte pro Zoll, gerade ausgerichtete Seite, deutlicher Kontrast), wählen Sie den richtigen Segmentierungsmodus und überprüfen Sie das Ergebnis anhand von etwa zwanzig Seiten, bevor Sie eine Stapelverarbeitung starten.
Was es nicht ist: ein Werkzeug zum Verstehen von Dokumenten. Es gibt Text aus, gegebenenfalls mit Positionsangaben. Es erkennt einen Textblock nicht als Überschrift, rekonstruiert eine Tabelle nicht in Zeilen und Spalten und versteht nicht, was es liest. Bei einem strukturierten Dokument ist OCR nur einer von mehreren Bausteinen.
#Französisch: die Sprachdatei
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
Standardmäßig erkennt Tesseract englischen Text. Bei einem französischen Dokument führt das zu verlorenen Akzenten und ungenau erkannten Wörtern — und viele schließen daraus, dass die OCR-Engine schlecht sei. Die Dokumentation stellt klar, dass ohne die Option -l Englisch angenommen wird. Daher muss die Datendatei für die jeweilige Sprache installiert und die Sprache beim Ausführen ausdrücklich angegeben werden. Nach Angaben des Projekts können mit den richtigen installierten Paketen mehr als hundert Sprachen erkannt werden.
#Die Bildqualität ist entscheidend
Diesen Punkt entdeckt man oft zu spät: Die offizielle Dokumentation widmet ihre Seite „Improve quality“ der Bildverarbeitung, bevor sie auf die Einstellungen der OCR-Engine eingeht. Tesseract führt bereits interne Verarbeitungsschritte durch (Bibliothek Leptonica), doch diese reichen nicht immer aus, und eine Vorverarbeitung mit wenigen Codezeilen genügt oft, um einen schlechten Scan lesbar zu machen. Koncile, ein Anbieter von Software zur Rechnungsextraktion, zeigt das Ausmaß dieses Effekts in eigenen, 2026 veröffentlichten Tests: Bei einer Rechnung, die um lediglich drei bis fünf Grad geneigt ist, sinkt die Quote korrekt gelesener Inhalte von 100 % auf 31 %. Das ist keine unabhängige Studie, doch die Größenordnung entspricht der Warnung in der offiziellen Dokumentation. Keine Einstellung der OCR-Engine kann einen solchen Einbruch ausgleichen; das kann nur eine vorherige Begradigung.
- Auflösung
- Die offizielle Dokumentation weist darauf hin, dass Tesseract auf Bildern mit mindestens 300 Punkten pro Zoll besser funktioniert und empfiehlt, die Größe anzupassen, wenn dies nicht der Fall ist.
- Begradigung
- Die Dokumentation warnt davor, dass die Qualität der Zeilensegmentierung erheblich abnimmt, wenn die Seite zu schief ist: Die Bildaufnahme muss gedreht werden, damit die Zeilen horizontal sind. Siehe die Zahl oben.
- Kontrast und Binarisierung
- Tesseract binarisiert intern mit dem Otsu-Algorithmus, was bei einem ungleichmäßig gefärbten Hintergrund manchmal zu mäßigen Ergebnissen führt. Version 5.0 hat zwei Methoden hinzugefügt, Adaptive Otsu und Sauvola, die über die Parameter thresholding_* einstellbar sind. Ab Version 4 benötigt die Engine dunklen Text auf hellem Hintergrund.
- Ränder
- Sehr breite Ränder stören die OCR-Engine, zu knapp zugeschnittener Text aber ebenfalls: Die Dokumentation empfiehlt, um einen Ausschnitt ohne Rand einen kleinen weißen Rand hinzuzufügen (10 Pixel in ihrem Beispiel).
- 01Die Seite gerade ausrichtenDen vorherrschenden Winkel des Textes erkennen und das Bild vor allen weiteren Schritten drehen; ein einfaches Skript auf Basis der Hough-Transformation reicht für die meisten Büroscanner aus.
- 02Kontrast verbessernIn Graustufen umwandeln und anschließend binarisieren (mit adaptiver Schwellenwertbildung statt eines festen Schwellenwerts, der bei ungleichmäßiger Beleuchtung versagt), um reines Schwarz auf reinem Weiß zu erhalten.
- 03Zuschneiden und OCR startenScanränder und große leere Ränder entfernen, einen schmalen weißen Rand um den Text lassen und anschließend Tesseract mit der zum Dokumenttyp passenden Sprache und dem passenden Segmentierungsmodus aufrufen.
#Die Einstellungen, die das Ergebnis verändern
| Option | Was sie tut | Wann Sie die Option ändern sollten |
|---|---|---|
| Seitensegmentierungsmodus (--psm) | Gibt der OCR-Engine an, wie die Seite aufgebaut ist: einzelner Block, Spalte, einzelne Zeile (7), verstreuter Text (11) | Bei einem Beleg, einem Etikett, einer schmalen Spalte oder einem kleinen Bildausschnitt: Der Standardmodus erwartet eine ganze Seite |
| Engine-Modus (--oem) | 1: nur das neuronale LSTM-Netz; 0: die bisherige Engine | Selten: Die Sprachdateien der gängigen Linux-Pakete (tessdata_fast) unterstützen nur LSTM, und die Modi 0 und 2 funktionieren mit ihnen nicht. |
| Liste der erlaubten Zeichen (tessedit_char_whitelist) | Beschränkt die Erkennung auf eine Teilmenge von Zeichen | Bei einem rein numerischen Feld, um Verwechslungen zwischen Buchstaben und Ziffern zu verringern |
| Wörterbücher (load_system_dawg, load_freq_dawg) | Zwei Variablen, die die Wortlisten der OCR-Engine aktivieren | Bei Belegen, Preislisten und Codes: Sie zu deaktivieren kann helfen, wenn der Großteil des Textes nicht aus geläufigen Wörtern besteht. |
Der Segmentierungsmodus ist die Einstellung, die am häufigsten vergessen wird. Die Dokumentation weist darauf hin: Standardmäßig erwartet Tesseract eine Textseite, und zum Lesen eines kleinen Bereichs muss ein anderer Modus gewählt werden. Bei einem Bild mit nur einer Zeile behandelt Modus 7 diese als einzelne Zeile. Bei verstreutem Text ohne bestimmte Reihenfolge – etwa einem Screenshot mit verteilten Beschriftungen – vermeidet der entsprechende Modus dasselbe Problem. Der Engine-Modus hingegen verändert das Ergebnis selten, und zwar aus einem praktischen Grund: Die ältere Engine ist nur in den Sprachdateien des tessdata-Repositorys enthalten, nicht in den schnellen oder präzisen Varianten, die die meisten Distributionen mitliefern.
Bei sauberem, gut erfasstem Drucktext bleibt Tesseract konkurrenzfähig: FastOCR, ein Online-OCR-Dienst, der eine Cloud-Alternative verkauft, gibt für Tesseract v5 bei sauberem englischem Text eine Genauigkeit von 95 bis 97,2 % an, gegenüber 98,2 bis 99,1 % bei Google Cloud Vision. Diese Zahlen stammen von einem Anbieter mit eigenem wirtschaftlichem Interesse, der kein Testprotokoll veröffentlicht hat: Betrachten Sie sie als grobe Größenordnung, nicht als Messung. Die Wahl der OCR-Engine sollte sich nach der tatsächlichen Beschaffenheit der Dokumente richten: Bei sauberen, gedruckten Dokumenten reicht Tesseract völlig aus; bei beschädigten, handschriftlichen oder dicht strukturierten Dokumenten wird es zum schwächsten Glied der Kette.
#Tesseract oder ein Vision-Modell
| Kriterium | Tesseract | Lokales Vision-Modell |
|---|---|---|
| Ressourcen | Prozessor allein | GPU wünschenswert, mehrere Gigabyte |
| Geschwindigkeit | Sehr schnell | Erheblich langsamer |
| Sauberer Text in einer Spalte | Ausgezeichnet | Äquivalent, teurer |
| Komplexe Formatierung, Tabellen | Gering: Die Projektdokumentation weist auf ein bekanntes Problem mit Tabellen hin | Deutlich besser |
| Handschrift | Sehr gering: 25 bis 40 % gemäß FastOCR | Erheblich besser |
| Inhaltsverständnis | Keine | Kann eine Frage zum Dokument beantworten |
| Risiko erfundener Inhalte | Niedrig: Er verwechselt Zeichen anstatt Werte zu bilden | Real: Ein Modell kann einen plausiblen Wert halluzinieren |
Diese letzte Zeile ist für jede Dokumentenprüfung wichtig: Tesseract macht Fehler, indem es Zeichen verwechselt, während ein Bildverarbeitungsmodell eine formal einwandfreie, aber falsche Zahl erzeugen kann. Der Unterschied ist nicht absolut, denn auch eine 0, die in einem Betrag als 8 gelesen wird, fällt nicht auf. Ein unsinniger Text verrät jedoch häufiger eine OCR-Engine als ein plausibler, erfundener Wert. Ein 2026 veröffentlichter Vergleich fasst die veränderte Landschaft zusammen: Die wirklichen Alternativen sind keine klassischen OCR-Engines mehr, sondern quelloffene Vision-Language-Modelle, wobei PaddleOCR-VL ausdrücklich genannt wird – allerdings mit einem zusätzlichen Aufwand, denn diese Modelle benötigen eine GPU, während Tesseract mit einem gewöhnlichen Prozessor auskommt.
- Lokale multimodale Modelle – was sie lesen können
- Daten aus einer Rechnung extrahieren: der vollständige Ablauf
- Strukturierte Dokumente mit Docling konvertieren
- PaddleOCR: die Engine, die komplexe Layouts verarbeitet
- Quelle: offizielles Tesseract-Repository auf GitHub
- Quelle: Koncile, Tesseract-Vergleich 2026 (Anbieter von Software zur Rechnungsextraktion)
- Quelle: Tesseract-Manpage (Optionen --psm und --oem)
- Quelle: Dokumentation von Tesseract, Qualität verbessern
- Quelle: Tesseract-Dokumentation, Datendateien
#Die tatsächlichen Kosten eines Tesseract-Projekts
Die OCR-Engine selbst kostet nichts, was oft verschleiert, wofür bei einem OCR-Projekt tatsächlich Zeit aufgewendet wird. Die eigentliche Arbeit liegt in den Schritten rund um die Engine: Bildvorverarbeitung (Geraderichten, Binarisierung, Ränder) und Überprüfung des Ergebnisses. Eine realistische Budgetplanung sieht von Anfang an Zeit für diese beiden Schritte vor, statt sie erst nach einem ersten Stapel enttäuschender Ergebnisse zu entdecken.
- Scanner oder Handyfoto
- Ein Flachbettscanner liefert gerader ausgerichtete und besser ausgeleuchtete Seiten als eine freihändig aufgenommene Fotografie; den Scanner bevorzugen, sobald der Umfang dies rechtfertigt.
- Ausgabeformat
- Reiner Text reicht für die Indexierung aus; das hOCR-Format bewahrt die Positionen, was nützlich ist, um einen Auszug in der ursprünglichen Benutzeroberfläche hervorzuheben.
- Qualitätskontrolle
- Eine nach jedem Wechsel der Scanquelle von Hand überprüfte Stichprobe erkennt eine schleichende Abweichung, bevor sie den gesamten Stapel betrifft.
- Volumen und Parallelisierung
- Tesseract nutzt standardmäßig mehrere Threads (OpenMP), was für große Stapel nicht geeignet ist. Die Projekt-FAQ empfiehlt, mit der Variablen OMP_THREAD_LIMIT=1 einen Prozess pro Kern zu starten, wodurch der zusätzliche Aufwand des Multithreadings entfällt.
Ein letzter, oft vergessener Punkt: die Benennung der erzeugten Dateien. Bei mehreren Tausend Seiten muss sich nachvollziehen lassen, welcher Text zu welchem Scan gehört; denselben Basisnamen für das Bild und den erkannten Text beizubehalten, löst das Problem von Anfang an.
#In eine lokale Verarbeitungskette einbinden
In einem lokalen System zur Dokumentenverarbeitung kommt Tesseract nur an einer Stelle zum Einsatz: direkt vor der Indexierung, bei Dokumenten ohne Textebene. Der zu automatisierende Test ist einfach – liefert die Textextraktion aus einem PDF weniger als einige Dutzend Zeichen pro Seite (den Schwellenwert an Ihren Korpus anpassen), handelt es sich wahrscheinlich um einen Scan, der per OCR verarbeitet wird. Ohne diesen Test landen ganze Dokumente unbemerkt ohne Inhalt im Index, und niemand bemerkt es, bis sich ein Nutzer wundert.
Die Schräglagenkorrektur und die Binarisierung sollten in derselben Pipeline automatisiert werden, statt bei jeder Seite einzeln darüber zu entscheiden: Ein Skript, das den vorherrschenden Winkel erkennt und die Schräglage vor dem Aufruf der OCR-Engine korrigiert, vermeidet einen großen Teil der oben beschriebenen unangenehmen Überraschungen. Bei einem homogenen Stapel – immer derselbe Scanner, derselbe Dokumenttyp – wird diese Vorverarbeitung einmal eingestellt und läuft anschließend ohne Überwachung.
#FAQ
Ist Tesseract kostenlos?+
Wie bringt man es dazu, französischen Text zu erkennen?+
Warum ist mein Ergebnis unleserlich?+
Kann Tesseract Tabellen lesen?+
Sollte ein Vision-Modell bevorzugt werden?+
Was ist der Seitensegmentierungsmodus?+
Wie macht man ein gescanntes PDF mit Tesseract durchsuchbar?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.