Mittelstufe 12 Min.Vision

PaddleOCR: das OCR-Modell, das den page

Direkte Antwort

PaddleOCR ist eine freie OCR-Toolbox (Apache-2.0-Lizenz, über 90.000 Sterne auf GitHub), die Text an beliebigen Stellen einer Seite erkennt und Tabellen rekonstruiert. Mit der Variante PaddleOCR-VL erreicht ein Vision-Modell mit etwa 0,9 Milliarden Parametern 96,33 % auf dem Referenzbenchmark OmniDocBench v1.6: Damit lässt sich eine Software, die Zeile für Zeile liest, bei realen Dokumenten ersetzen – allerdings mit einer aufwendigeren Installation.

PaddleOCR leistet, was eine klassische OCR-Engine nicht kann: Text an beliebiger Stelle auf einer Seite erkennen, dicht gesetzte Schrift lesen und die Struktur einer Tabelle rekonstruieren. Es ist aufwendiger als die bisherige Engine und bietet genau das, was bei wichtigen Dokumenten gebraucht wird — Rechnungen, Formularen, Berichten und mehrsprachigen Scans.

Von Mohamed Meguedmi·Aktualisierung 2026-09-29·Unter Windows, macOS und Linux getestet

#Zuerst die Erkennung: Was das verändert

PaddleOCR ist eine freie OCR-Toolbox unter der Apache-2.0-Lizenz, die eine Seite nicht Zeile für Zeile liest: Sie ermittelt zuerst, wo sich der Text befindet, liest dann jeden Bereich und kann anschließend die Struktur der Seite und ihrer Tabellen rekonstruieren. Das macht sie robust bei Rechnungen, Formularen, schief eingescannten Seiten und mehrsprachigen Dokumenten, bei denen eine OCR-Engine wie Tesseract mit großer Sicherheit unsinnige Ergebnisse liefert. Das Projekt umfasst zwei Familien: eine modulare Pipeline (PP-OCRv6 für die Texterkennung, PP-StructureV3 für die Struktur) und PaddleOCR-VL, ein Vision-Modell mit etwa 0,9 Milliarden Parametern, das eine Seite in einem einzigen Durchlauf in Markdown umwandelt und laut seinem Herausgeber 96,33 % auf OmniDocBench v1.6 erreicht. Der Preis dafür ist eine aufwendigere Installation mit PaddlePaddle und Modellgewichten sowie dokumentierte GPU-Voraussetzungen für die VL-Variante. Für große Mengen sauberen Textes bleibt eine schlanke OCR-Engine die einfachere Lösung.

Eine klassische Engine geht davon aus, dass eine Seite aus Textzeilen besteht, die wie in einem Buch angeordnet sind. Bei realen Dokumenten ist das anders: Eine Rechnung enthält umrahmte Bereiche, ein Formular hat Felder, eine Präsentation hat Text über Bildern, ein Scan liegt schief vor und ein technischer Plan enthält schräge Beschriftungen.

PaddleOCR teilt das Problem in zwei Schritte auf. Ein Detektionsmodell findet Textbereiche unabhängig davon, wo sie liegen, und gibt ihre Positionen zurück; ein Erkennungsmodell liest jeden Bereich. Ein schräg stehender Text, eine Beschriftung am Rand und eine Zahl in einer Zelle werden zu drei Bereichen unter vielen. Dadurch kommt PaddleOCR auch mit Dokumenten zurecht, bei denen ein zeilenweise arbeitendes Lesesystem Fehler macht, ohne sie erkennen zu lassen.

#Die Schritte der Pipeline

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen
Was jeder Schritt erzeugt
SchrittWas er erzeugtWarum das zählt
TexterkennungRahmen um jede TextzoneNichts wird wegen einer ungewöhnlichen Position übersehen
Klassifikation der AusrichtungDie korrekte Ausrichtung jeder ZoneSchiefe Scans sind kein Sonderfall mehr
ErkennungDie Zeichenkette jedes FramesDer eigentliche Leseschritt
LayoutanalyseDer Typ jeder Zone: Titel, Absatz, Abbildung, TabelleDie Aufteilung kann sich an der Struktur statt an der Zeichenanzahl orientieren
TabellenerkennungZeilen, Spalten, ZellenDie Zahlen behalten die Bezeichnung, die ihnen Bedeutung verleiht

Nicht alle Schritte sind erforderlich. Zum Lesen einiger Etiketten genügen Detektion und Texterkennung; die Aufnahme von Finanzberichten für eine Dokumentenrecherche rechtfertigt die vollständige Verarbeitungskette. PP-OCRv6, die 2026 veröffentlichte Generation von Texterkennungsmodellen, deckt allein 50 Sprachen in einem einheitlichen Modell ab (Chinesisch, Englisch, Japanisch und 46 Sprachen mit lateinischem Alphabet), ohne dass zwischen den Sprachen das Modell gewechselt werden muss.

#PaddleOCR-VL: OCR wird zum Vision-Modell

Seit Oktober 2025 veröffentlicht das Projekt eine zweite Familie unter demselben Namen: PaddleOCR-VL, ein kompaktes Vision-Language-Modell, das die gesamte fünfstufige Pipeline durch einen einzigen Durchlauf ersetzt. Die Ende Mai 2026 erschienene Version 1.6 hat etwa 0,9 Milliarden Parameter und kombiniert einen visuellen Encoder mit dynamischer Auflösung mit einem kleinen Sprachmodell. Auf OmniDocBench v1.6, dem Referenzbenchmark für die Umwandlung von Dokumenten in Markdown oder JSON, erreicht sie einen Score von 96,33 %, ein Niveau, das das Projekt selbst als neuen Stand der Technik bezeichnet.

Was auffällt, ist nicht nur der Score, sondern auch die Größe des Modells, das ihn erzielt. Ein von InsiderLLM veröffentlichter Leitfaden fasst die Lage in einem Satz zusammen: Ein Modell mit 900 Millionen Parametern übertrifft ein Modell mit 72 Milliarden Parametern und GPT-4o bei der OCR von Dokumenten. Derselbe Artikel beziffert den Speicherbedarf des Allround-Konkurrenten — Qwen2.5-VL-72B benötigt bei Q4-Quantisierung mindestens 48 GB VRAM —, während PaddleOCR-VL, ins GGUF-Format konvertiert und in Q4_K_M quantisiert, ungefähr ein bis eineinhalb Gigabyte belegt, einschließlich der Gewichte des Sprachmodells und des visuellen Projektors. Dieser GGUF-Ansatz ist noch neu: Die Unterstützung für PaddleOCR-VL wurde im Februar 2026 (Version b8110) in llama.cpp integriert, und die verfügbaren GGUF-Dateien stammen aus der Community, nicht vom PaddleOCR-Team.

Die Komponente, die den OmniDocBench-Score erzielt, steht nicht allein: Neben PaddleOCR-VL pflegt das Projekt PP-StructureV3, eine Pipeline zur Konvertierung komplexer PDFs in Markdown oder JSON mit den präzisen Koordinaten jeder Tabellenzelle und jedes Textblocks. Beide Komponenten verfolgen dasselbe Ziel – ein reales Dokument sauber zu konvertieren –, gehen dabei aber zwei verschiedene Wege: ein einziges Modell bei PaddleOCR-VL und eine Kette spezialisierter Komponenten bei PP-StructureV3. Die jeweilige Engine unterstützt Multi-GPU- und Multi-Prozess-Inferenz nativ. Das ist entscheidend, sobald ein Korpus mit mehreren Zehntausend Seiten in angemessener Zeit verarbeitet werden muss.

i
Zwei Produkte, ein einziger Name
PaddleOCR (die modulare Pipeline mit fünf Schritten) und PaddleOCR-VL (das Vision-Language-Modell mit einem einzigen Durchlauf) sind zwei unterschiedliche Werkzeuge, die vom selben Team veröffentlicht werden. Ersteres eignet sich für große Datenmengen, bei denen man jeden Schritt kontrollieren möchte; letzteres für komplexe Dokumente, die man direkt in strukturiertes Markdown umwandeln möchte, ohne eine Pipeline aufzubauen.

#PaddleOCR oder Tesseract

Zwei Budgets statt zwei Rivalen (qualitative Bewertungen)
PaddleOCRTesseract
InstallationPython-Stack und ModellgewichteEine kleine Binärdatei
Sauberer einspaltiger ScanAusgezeichnetAusgezeichnet und schneller
Text irgendwo auf der SeiteAusgezeichnetSchwach
TabellenRekonstruierte StrukturAplatis
Nicht lateinische SchriftenSehr gutHängt stark vom Sprachpaket ab
Um einige Grad geneigtes DokumentDurch die Orientierungsklassifizierung korrigiertKann den Lesetempo verlangsamen
GPUOptional, großer NutzenNicht verwendet

Eine gut konzipierte Pipeline nutzt beide: einfache Seiten für die ressourcenschonende Engine, komplexe Seiten für die ressourcenintensive Engine. Diese Zuordnung kostet nichts und spart bei einem großen Korpus Stunden. Die Angabe zur Neigung ist kein nebensächliches Detail: Koncile, ein Softwareanbieter für Rechnungsextraktion, hat in eigenen Tests gemessen, dass die Erkennungsrate von Tesseract von 100 % bei einer geraden Rechnung auf 31 % sank, sobald der Scan um nur 3 bis 5 Grad geneigt war – genau der Fall, für den die Orientierungsklassifikation von PaddleOCR ausgelegt ist.

#Anwendungsfälle: Wann auf PaddleOCR wechseln

Rechnungsstellung und Buchhaltung
Ein Rechnungsscan ist selten vollkommen gerade ausgerichtet; die Tabellenstruktur (Menge, Stückpreis, MwSt.) muss lesbar bleiben, damit die Beträge ihre Bedeutung behalten, statt als Zeile isolierter Zahlen zu enden.
Mehrsprachige Verwaltungsakten
Formulare, Ausweisdokumente, Briefe in verschiedenen Schriftsystemen: Die breite Sprachabdeckung von PaddleOCR erspart es, für jedes Land oder Alphabet eine andere Engine einzurichten.
Lange Berichte für ein RAG
Ein Bericht von mehreren Dutzend Seiten mit Überschriften, Zwischenüberschriften und Tabellen sollte unter Erhalt seiner Struktur konvertiert werden: Eine Aufteilung entlang der Abschnitte ist besser als eine Aufteilung nach Zeichenanzahl.
Ungeordnete gescannte Archivbestände
Kisten voller Papierdokumente, unsorgfältig gescannt und beliebig ausgerichtet: Die Klassifizierung der Ausrichtung beseitigt den größten Teil dieses Durcheinanders schon vor dem Lesen.
Hohes Volumen und sauberer Text
Umgekehrt ist bei großen Mengen von Kassenbelegen oder Auszügen, die bereits gut im Bild erfasst sind, oft weiterhin eine schlankere Engine die bessere Wahl — siehe den Vergleich mit Tesseract weiter oben.

#Installieren und eine erste Extraktion starten

Die Installation erfolgt über pip, mit einer Besonderheit: Seit der Versionsreihe 3.x reicht das Paket paddleocr allein nicht aus. Die Dokumentation verlangt, zuerst die gewählte Inferenz-Engine (standardmäßig PaddlePaddle) und anschließend das Paket paddleocr zu installieren. Die Gewichte der Modelle für die Detektion, die Erkennung und gegebenenfalls das Seitenlayout werden beim ersten Start jeder verwendeten Pipeline heruntergeladen.

  1. 01
    Bibliothek installieren
    Zuerst PaddlePaddle gemäß der offiziellen Installationsseite installieren (je nach Rechner die CPU- oder GPU-Variante), anschließend python -m pip install paddleocr ausführen. Das Basispaket unterstützt Python 3.8 oder höher; die optionalen Zusatzkomponenten für die Dokumentanalyse (paddleocr[doc-parser]) erfordern Python 3.9 oder höher.
  2. 02
    Erste Extraktion starten
    Der Befehl paddleocr ocr nimmt ein Bild als Eingabe (Option -i) und schreibt die Ergebnisse in den durch --save_path angegebenen Ordner. Um eine Seite mit PaddleOCR-VL in Markdown umzuwandeln, lautet der Befehl paddleocr doc_parser, mit denselben Optionen -i und --save_path.
  3. 03
    Nützliche Schritte aktivieren
    Die Optionen use_doc_orientation_classify, use_doc_unwarping und use_textline_orientation aktivieren die Korrektur schief ausgerichteter Seiten oder Textzeilen. Bei sauberen Scans beschleunigt es die Verarbeitung, diese Optionen auf False zu setzen; die offizielle Dokumentation empfiehlt außerdem, unnötige Funktionen zu deaktivieren, wenn die Inferenz zu langsam ist.
Terminal (nach Installation von PaddlePaddle)
python -m pip install paddleocr
paddleocr ocr -i ./facture.jpg --use_doc_orientation_classify True --use_textline_orientation True --save_path ./output
→
Direkt nutzbare Ausgabe
Das Ergebnis umfasst den erkannten Text, die Koordinaten jedes Bereichs und, wenn die Strukturerkennung aktiviert ist, einen Markdown- oder JSON-Export, der direkt für die Dokumentensuche indexiert oder an ein Sprachmodell gesendet werden kann. Sie müssen keinen eigenen Parser schreiben, um herauszufinden, welche Zelle zu welcher Tabelle gehört.

#Was es verbraucht

Das Projekt veröffentlicht keinen allgemeingültigen Durchsatz pro Seite: Er hängt von der Dokumentdichte, den aktivierten Verarbeitungsschritten und der Hardware ab. Die Dokumentation empfiehlt, unnötige Funktionen zu deaktivieren oder bei langsamer Inferenz leichtere Modelle zu wählen. Messen Sie anhand von etwa zwanzig Ihrer Seiten, bevor Sie die Ergebnisse auf ein Korpus hochrechnen. Für PaddleOCR-VL nennt die offizielle Dokumentation die Anforderungen an NVIDIA-GPUs (PaddlePaddle: Compute Capability 7.0 oder höher und CUDA 11.8 oder höher; vLLM: 8.0 oder höher und CUDA 12.6 oder höher) und sieht auch eine Möglichkeit für den Betrieb auf x64-Prozessoren vor. Die Gewichte werden einmal heruntergeladen, danach läuft alles lokal: keine API, keine Kosten pro Seite.

!
Die GPU wird geteilt
Auf einem Rechner, der auch ein Sprachmodell bereitstellt, konkurrieren OCR-Verarbeitung und Inferenz um denselben Speicher. Die stapelweise Datenaufnahme wird gestartet, wenn niemand das System abfragt, und das Ergebnis wird zwischengespeichert: Ein Dokument wird einmal konvertiert, nicht bei jeder Frage.

#Das entscheidende Argument: keine erfundenen Inhalte

PaddleOCR liest Pixel. Es kann ein Zeichen falsch lesen, und eine ersetzte Ziffer fällt nicht immer auf. Ein allgemeines Bildverarbeitungsmodell, das ein Dokument transkribieren soll, kann einen formal korrekten, plausiblen Wert erzeugen, der auf der Seite gar nicht vorkommt – und nichts in der Ausgabe weist darauf hin. Bei PaddleOCR-VL ist besondere Vorsicht geboten: Da es den Text erzeugt, statt ihn Bereich für Bereich zu lesen, gehört es zur selben Risikokategorie wie allgemeine Bildverarbeitungsmodelle, auch wenn es für die Transkription trainiert wurde. Kein System ist vor einem Fehler bei einem mehrdeutigen Zeichen gefeit.

Bei der Dokumentenprüfung, in der Buchhaltung oder bei allem, was auditierbar sein muss, sollte dieser Unterschied die Wahl bestimmen: eine spezialisierte OCR-Engine für die Zahlen, auf die Sie sich stützen werden, und ein allgemeines Bildverständnismodell, wenn das Dokument erklärt statt transkribiert werden soll. Bei Dokumenten, bei denen viel auf dem Spiel steht, bleibt es eine berechtigte dritte Option, beide zu verwenden und die Ergebnisse zu vergleichen.

In der Praxis muss man zur Überprüfung nicht alles erneut lesen. Eine Stichprobe von einigen Dutzend Dokumenten pro Stapel, die manuell mit der Ausgabe der OCR-Engine verglichen wird, genügt, um eine systematische Abweichung zu erkennen – ein falsch abgegrenztes Feld, eine falsch erkannte Sprache oder eine regelmäßig falsch segmentierte Tabelle –, bevor diese Abweichung Tausende automatisch verarbeiteter Seiten beeinträchtigt.

#FAQ

Ist PaddleOCR kostenlos?+
Ja. Das Projekt ist unter der Apache-2.0-Lizenz veröffentlicht, vollständig frei nutzbar, auch für kommerzielle Zwecke, und hat mehr als 90.000 Sterne auf GitHub. Es läuft lokal, ohne API-Schlüssel oder Kosten pro Seite. Prüfen Sie dennoch die Lizenz der konkreten Modelle, die Sie herunterladen, da für manche Forschungsvarianten andere Bedingungen gelten können.
Braucht man eine GPU?+
Nein, für den Einstieg nicht: Die klassische Pipeline läuft auf der CPU, und die Dokumentation von PaddleOCR-VL beschreibt eine Möglichkeit für den Betrieb auf x64-CPUs. Eine NVIDIA-GPU ist weiterhin die am besten dokumentierte Konfiguration und wird nützlich, sobald das Volumen einige tausend Seiten übersteigt. Das Projekt veröffentlicht keine Zeitangabe pro Seite auf der CPU: Messen Sie mit Ihren eigenen Dokumenten.
PaddleOCR oder Tesseract?+
Tesseract für sauberen, einspaltigen Text in großen Mengen: Es ist schneller und ressourcenschonender, solange der Scan gerade ausgerichtet ist. PaddleOCR für unübersichtliche Layouts, schräg ausgerichtete Scans, Formulare, Tabellen und nichtlateinische Schriften, bei denen die schlanke OCR-Engine schnell an Zuverlässigkeit verliert.
Kann es Tabellen extrahieren?+
Ja, die Strukturerkennung gehört zum Werkzeugkasten, entweder über die klassische Verarbeitungskette oder über PP-StructureV3: Zeilen, Spalten und Zellen werden rekonstruiert, statt zu einer einzigen Zahlenzeile zusammengefasst zu werden. Kein Benchmark-Ergebnis garantiert das Ergebnis für Ihre eigenen Tabellen: Prüfen Sie einige Dokumente von Hand, insbesondere solche mit verbundenen Zellen, bevor Sie dem gesamten Workflow vertrauen.
Was ist PaddleOCR-VL genau?+
Ein Vision-Language-Modell mit etwa 0,9 Milliarden Parametern, veröffentlicht vom selben Team wie die klassische OCR-Pipeline. Es wandelt eine Seite in einem einzigen Durchlauf direkt in Markdown oder strukturiertes JSON um und erreicht im Benchmark OmniDocBench v1.6 einen Wert von 96,33 %, ohne dass eine separate Verarbeitungskette für Detektion, Erkennung und Strukturierung aufgebaut werden muss.
Funktioniert es offline?+
Ja, sobald die Modellgewichte heruntergeladen sind. Danach verlassen keine Daten mehr den Rechner. Das ist der Hauptgrund, es für vertrauliche Dokumente zu wählen: Rechnungen, medizinische Akten oder juristische Unterlagen bleiben auf Ihrem Laufwerk, vom ersten gelesenen Byte bis zum letzten extrahierten Zeichen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.