Mittelstufe 12 Min.Edge

MiniCPM lokal (Ollama): das multimodale compact

Direkte Antwort

MiniCPM-V ist die Serie kompakter Vision-Language-Modelle von OpenBMB unter der Apache-2.0-Lizenz. In Ollama lädt der Tag minicpm-v noch die Version 2.6 (8 Milliarden, 5,5 GB), minicpm-v4.5 eine 8-Milliarden-Version mit 6,1 GB und minicpm-v4.6 ein Modell mit etwa 1,3 Milliarden Parametern und 1,6 GB. Beginnen Sie mit der 4.6 auf einem kleinen Gerät und vergleichen Sie dann anhand Ihrer Bilder.

MiniCPM ist die Familie kompakter Modelle von OpenBMB. Dazu gehören Vision-Language-Modelle, die dort laufen sollen, wo große Modelle nicht mehr hinein passen. Die Modellfamilie hat sich stark weiterentwickelt: Die Version, die der bisherige Ollama-Tag lädt, ist nicht mehr die neueste, und inzwischen gibt es ein Modell mit 1,3 Milliarden Parametern. Diese Seite erklärt, welchen Tag Sie installieren sollten, wie aussagekräftig die angekündigten Zahlen sind und wo die OCR eines Allzweckmodells an ihre Grenzen stößt.

Von Samir K.·Aktualisierung 2026-09-29·Unter Windows, macOS und Linux getestet

#Welche Version von MiniCPM im Jahr 2026 installieren?

MiniCPM-V ist die Serie kompakter Vision-Sprach-Modelle von OpenBMB, entwickelt von THUNLP (Tsinghua-Universität) und ModelBest, deren Gewichte und Code unter der Apache-2.0-Lizenz veröffentlicht werden. In Ollama gibt es drei Tags nebeneinander, die für Verwirrung sorgen. Das Tag minicpm-v ohne Suffix entspricht weiterhin MiniCPM-V 2.6, einem Modell mit 8 Milliarden Parametern, einer Größe von 5,5 GB und einem Kontextfenster von 32K. Das Tag minicpm-v4.5 lädt eine neuere Version mit 8 Milliarden Parametern (6,1 GB, 40K Kontext). Das Tag minicpm-v4.6, das laut dem Projekt-Repository am 25. Juni 2026 in die offizielle Ollama-Bibliothek aufgenommen wurde, hat eine Größe von 1,6 GB bei etwa 1,3 Milliarden Parametern. Um lokale Bildverarbeitung auf einem kleinen Rechner kennenzulernen, beginnen Sie mit 4.6; behalten Sie 4.5 für Vergleiche mit Ihren inhaltsreichen Dokumenten, denn es gibt keine Garantie dafür, dass ein Modell mit 1,3 Milliarden Parametern dicht gesetzten Text genauso gut liest wie eines mit 8 Milliarden.

Die Ollama-Tags der MiniCPM-Familie (Einträge in der Bibliothek, September 2026)
Ollama-TagVersionParameterHerunterladenAngegebene KontextlängeZusammenfassung
minicpm-vMiniCPM-V 2.68 Milliarden5,5 GB32KVersion von 2024: mehrere Bilder und Video; diese Version lädt der Tag ohne Suffix
minicpm-v4.5MiniCPM-V 4.58 Milliarden6,1 GB40KBasiert auf Qwen3-8B und SigLIP2-400M; Video mit hoher Bildrate; der Anbieter gibt 77,0 auf OpenCompass an
minicpm-v4.6MiniCPM-V 4.6etwa 1,3 Milliarden1,6 GB256KAm leichtesten und am neuesten; Kompression visueller Tokens; mobile Varianten
openbmb/minicpm-o4.5MiniCPM-o 4.59 Milliarden6,1 GB40KOmni-Version (Sprache, Echtzeitstreams); der Ollama-Eintrag nennt nur Text und Bilder als Eingaben
i
Drei Namen, die nicht verwechselt werden sollten
MiniCPM-V bezeichnet die Vision-Modelle, MiniCPM-o die Omni-Modelle, die zusätzlich Sprache und Echtzeit-Streaming bieten, und MiniCPM 5 die neue Reihe reiner Textmodelle für Geräte (MiniCPM5-1B und MiniCPM5-2B, letzteres mit etwa 2,5 Milliarden Parametern; beide bei OpenBMB in Ollama verfügbar). Für Bildanalyse und OCR benötigen Sie MiniCPM-V.

#Was die Serie bietet und was man relativieren muss

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Die Modellreihe strebt das beste Verhältnis zwischen Leistungsfähigkeit und Größe an. Laut dem OpenBMB-Repository erreicht MiniCPM-V 4.5 auf OpenCompass einen Wert von 77,0 und übertrifft mit 8 Milliarden Parametern GPT-4o-latest, Gemini 2.0 Pro und Qwen2.5-VL 72B. Für Version 4.6 nennt das Projekt einen visuellen Encoder mit einem um mehr als 50 % geringeren Rechenaufwand, eine wählbare Kompression der visuellen Tokens (4-fach oder 16-fach) und einen Token-Durchsatz, der etwa 1,5-mal so hoch ist wie der von Qwen3.5-0.8B. Die Ollama-Modellseite desselben Modells nennt einen 2,4-mal so hohen Durchsatz: Beide Zahlen stammen vom Projekt, und auf diesen Seiten wird kein Messprotokoll im Detail beschrieben. Das sind Angaben des Projekts, keine unabhängigen Messungen: Messen Sie die Laufzeiten auf Ihrer eigenen Hardware.

Kompakt und multimodal
Text und Bild, mehrere Bilder gleichzeitig und Video. Version 4.5 komprimiert laut Repository bis zu 6 Videobilder in 64 Tokens. Dadurch lassen sich mehr Bilder verarbeiten, ohne zusätzlichen Aufwand für das Sprachmodell.
Hochauflösende OCR
Version 4.5 verarbeitet Bilder mit beliebigem Seitenverhältnis und bis zu 1,8 Millionen Pixeln (zum Beispiel 1344 x 1344). Der Anbieter behauptet, dass sie unter den multimodalen Allzweckmodellen bei OCRBench und bei der PDF-Analyse (OmniDocBench) führend ist; Version 4.6 soll bei mehreren Benchmarks, darunter OCRBench, das Niveau von Qwen3.5 2B erreichen.
Permissive Lizenz
Das Repository gibt an, dass die Gewichte und der Code unter der Apache-2.0-Lizenz stehen. Auch die Modellkarten auf Hugging Face für die Versionen 4.5 und 4.6 enthalten dieselbe Angabe. Prüfen Sie die genaue Lizenz der konkreten Version, die Sie herunterladen.
Viele Formate
Das Projekt bietet GGUF-, BNB-, AWQ- und GPTQ-Varianten an und gibt an, mit SGLang, vLLM, llama.cpp und Ollama kompatibel zu sein.

#Wie viel Speicher wirklich benötigt wird

Von OpenBMB angegebener Speicherbedarf und von Ollama angezeigte Größe der Modellgewichte
Modell und FormatAngegebener SpeicherbedarfQuelle
MiniCPM-V 4.6, Transformers (GPU)4 GBTabelle der Modelle im Repository
MiniCPM-V 4.6, GGUF (CPU)2 GBTabelle der Modelle im Repository
MiniCPM-V 4.6, BNB, AWQ oder GPTQ (GPU)3 GBTabelle der Modelle im Repository
MiniCPM-o 4.5, GGUF10 GBTabelle der Modelle im Repository
MiniCPM-o 4.5, GPU19 GBTabelle der Modelle im Repository
minicpm-v4.6 in Ollama1,6 GB DownloadOllama-Eintrag
minicpm-v4.5 in Ollama6,1 GB DownloadOllama-Eintrag

Diese Zahlen beschreiben die Modellgewichte und die grundlegende Ausführung: Kontext und Bilder benötigen zusätzlichen Speicher. Bilder werden in visuelle Tokens umgewandelt, die Platz im Kontextfenster belegen. Laut Ollamas Dokumentation verwendet Ollama bei weniger als 24 GiB VRAM standardmäßig 4.000 Kontexttokens; ein höherer Wert erhöht den Speicherbedarf. Der für Version 4.6 angegebene Kontext von 256K wird daher nicht automatisch reserviert. Schließlich weist die Tabelle im Repository für die GGUF-Version von 4.6 eine Ausführung auf der CPU aus, ohne eine Geschwindigkeit anzugeben: Messen Sie diese, bevor Sie Echtzeitbetrieb versprechen.

→
Die Auslagerung auf die CPU
Wenn Ollama das Modell zwischen GPU und CPU aufteilt, zeigt der Befehl ollama ps die Aufteilung in der Spalte PROCESSOR an. Die Ursache ist oft das Bild oder der Kontext, nicht die Modellgewichte: Verringern Sie die Bildauflösung oder den Wert von num_ctx, bevor Sie zu einer Quantisierung mit geringerer Bitbreite wechseln.

#MiniCPM-V mit Ollama installieren

Ollama übernimmt den Download, den visuellen Projektor und den API-Server: Sie müssen nichts Weiteres installieren. Aktualisieren Sie zunächst Ollama, da Version 4.6 erst seit Kurzem in der Bibliothek verfügbar ist. Die Seite zum Tag minicpm-v weist bereits darauf hin, dass dafür Ollama 0.3.10 oder höher erforderlich war.

  1. 01
    Modell herunterladen
    ollama pull minicpm-v4.6 récupère les poids du modèle de langage et le projecteur visuel, soit environ 1,6 Go. Pour le 4.5, utilisez minicpm-v4.5 (6,1 Go).
  2. 02
    Ersten Chat starten
    ollama run minicpm-v4.6 ouvre une session interactive. Posez une question texte avant de tester la vision.
  3. 03
    Bild senden
    Die Ollama-Dokumentation zeigt, dass der Dateipfad vor der Frage steht, zum Beispiel ollama run minicpm-v4.6 ./photo.jpg gefolgt von „Beschreibe dieses Bild“.
  4. 04
    Eine Oberfläche anbinden
    Sobald das Modell heruntergeladen wurde, erscheint es in Open WebUI oder in jedem Client, der auf Port 11434 zugreift.
Terminal
# Le plus léger (1,6 Go)
ollama pull minicpm-v4.6

# La version 8 milliards, pour comparer
ollama pull minicpm-v4.5

# Vérifier ce qui est installé, puis discuter
ollama list
ollama run minicpm-v4.6 ./photo.jpg Décris cette image

#Bildverarbeitung und OCR im Alltag

MiniCPM-V eignet sich gut für dokumentenbezogene Aufgaben: eine Rechnung lesen, einen Screenshot transkribieren, die Zeilen einer Tabelle extrahieren oder ein Foto beschreiben. Hochauflösende Bilder sind für OCR besonders wichtig, weil feine Schrift, die auf einem Vorschaubild unleserlich ist, bei voller Auflösung auswertbar wird. Formulieren Sie präzise Prompts: „Beschreibe dieses Bild“ liefert eine allgemeine Beschreibung, während „Transkribiere den gesamten sichtbaren Text originalgetreu und behalte das Layout bei“ ein deutlich saubereres Ergebnis liefert. Geben Sie für die Datenextraktion ein ausdrückliches Format vor: JSON, Markdown oder eine Tabelle.

API von Ollama: Extrahieren der Felder einer Rechnung
import base64, requests

with open("facture.png", "rb") as f:
    img = base64.b64encode(f.read()).decode()

r = requests.post("http://localhost:11434/api/generate", json={
    "model": "minicpm-v4.6",
    "prompt": "Extrais le total, la date et le numéro de facture en JSON.",
    "images": [img],
    "stream": False,
})
print(r.json()["response"])

Die REST-API von Ollama erwartet das Bild base64-codiert im Feld images, wie auch die Dokumentation erläutert; die SDKs akzeptieren zusätzlich einen Dateipfad. Wenn Sie Transformers statt Ollama verwenden, dokumentiert das Repository eine nützliche Einstellung für Version 4.6: Der Parameter downsample_mode hat standardmäßig den Wert 16x, und 4x behält viermal so viele visuelle Tokens bei, um feinere Details zu erfassen. Diese Einstellung sollten Sie ausprobieren, wenn sehr klein geschriebener Text schlecht erkannt wird.

!
Prüfen Sie immer die OCR
Kein kompaktes Vision-Modell ist bei kritischen Zahlenangaben wie Beträgen, Referenznummern oder Datumsangaben zu 100 % zuverlässig. Ein Vision-Modell kann einen korrekt formatierten Wert erzeugen, der auf der Seite gar nicht vorkommt. Behalten Sie für buchhalterische oder juristische Zwecke eine menschliche Nachprüfung oder eine Konsistenzprüfung der sensiblen Felder bei.

Wann sollten Sie eine spezialisierte OCR-Engine bevorzugen? Wenn Sie Tausende von Seiten verarbeiten und Nachvollziehbarkeit Vorrang hat, erzeugt eine spezialisierte Engine sichtbare Fehler statt plausibler Werte. PaddleOCR-VL, ein Modell mit weniger als einer Milliarde Parametern, erreicht laut seinem Anbieter 96,33 % auf OmniDocBench v1.6, und Tesseract bleibt die schlanke Wahl für sauberen Text. MiniCPM-V behält den Vorteil, wenn Sie auch das Bild beschreiben oder eine Frage dazu beantworten möchten.

#Im Vergleich zu Qwen3-VL und anderen kompakten Modellen

Der direkte Konkurrent von MiniCPM-V in der Kategorie der kompakten Vision-Modelle ist Qwen3-VL, das in Ollama insbesondere in Versionen mit 2, 4 und 8 Milliarden Parametern verfügbar ist. Beide decken denselben Bereich ab: Bildbeschreibung, OCR und Fragen zu einem Dokument. In der README von OpenBMB wird behauptet, dass MiniCPM-V 4.6 das größere Modell Gemma4-E2B-it in der Leistung übertrifft und effizienter als Qwen3.5-0.8B ist: Diese Vergleiche wurden vom Herausgeber veröffentlicht und beruhen auf seinen eigenen Evaluationen.

Kompakte Vision-Modelle, die in Ollama verfügbar sind
ModellAngezeigte GrößeDas können wir dazu sagenLeitfaden auf dieser Website
minicpm-v4.61,6 GBLaut Anbieter liegt es bei mehreren visuellen Benchmarks, darunter OCRBench, auf dem Niveau von Qwen3.5 2BDiese Seite
qwen3-vl:2b1,9 GBGleiche Größenklasse, angegebene Kontextlänge von 256KQwen3-VL lokal
qwen3-vl:8b6,1 GBGleiches Dateivolumen wie minicpm-v4.5Qwen3-VL lokal
MoondreamAnleitung ansehenLeichtes Vision-Modell, behandelt in einem separaten Leitfaden auf der WebsiteMoondream

Für die Wahl sind Ihre Bilder wichtiger als ein Datenblatt. Beide Modellfamilien laufen mit demselben Ollama und derselben API: Um von einer zur anderen zu wechseln, müssen Sie lediglich den Modellnamen in der Anfrage ändern. Nichts spricht dagegen, beide zu behalten und die Anfragen je nach Aufgabe an das passende Modell weiterzuleiten.

Mit demselben Bild vergleichen
ollama run minicpm-v4.6 ./ticket.jpg Transcris le texte de ce ticket
ollama run qwen3-vl:2b ./ticket.jpg Transcris le texte de ce ticket

#Edge, Mobilgeräte und Server: Was das Projekt dokumentiert

MiniCPM wurde für den Einsatz auf dem Gerät entwickelt. Das Repository gibt an, dass MiniCPM-V 4.6 auf iOS, Android und HarmonyOS bereitgestellt werden kann, wobei der Anpassungscode offen zugänglich ist, und zeigt unbearbeitete Bildschirmaufzeichnungen auf einem iPhone 17 Pro Max, einem Redmi K70 und einem HUAWEI nova 14. Ein Anwendungsrepository bietet den Download und die Bereitstellungsanleitung. Für die Bedienung mehrerer Nutzer kündigt das Projekt neben llama.cpp und Ollama auch Kompatibilität mit vLLM und SGLang an.

  1. 01
    Lokale Digitalisierung von Dokumenten
    Ein Mini-PC oder ein NAS mit einer Einsteiger-GPU verwandelt einen Ordner mit Scans in durchsuchbaren Text, ohne ein sensibles Dokument in die Cloud zu senden.
  2. 02
    Offline-Assistent
    Auf einem Laptop mit Apple Silicon oder einer einfachen Grafikkarte liest Version 4.6 den Bildschirminhalt und beantwortet Fragen zu Screenshots, auch ohne Internetverbindung.
  3. 03
    Vorverarbeitung in einer Pipeline
    Als Vorstufe eines aufwendigeren Systems übernimmt es die Vorsortierung: Dokumenttyp, eindeutig erkennbare Felder. Nur die schwierigen Fälle werden an ein großes Modell weitergeleitet.
  4. 04
    Alternativtexte in großen Mengen
    Bildbeschreibungen für eine Website oder eine Mediathek stapelweise generieren, ohne Kosten pro Aufruf, sobald sich die Hardware amortisiert hat.
i
MiniCPM-o 4.5: Sprachfunktionen erfordern einen anderen Software-Stack
MiniCPM-o 4.5 ergänzt Sprachgespräche und gleichzeitige Video- und Audiostreams, aber der Ollama-Eintrag nennt nur Text und Bilder als Eingaben. Für die Sprachfunktionen verweist das Repository auf Transformers oder llama.cpp-omni, und die dokumentierten Einschränkungen sind real: gelegentlich fehlerhafte Aussprache im Omni-Modus und Antworten, die manchmal Englisch und Chinesisch vermischen.

#Fehlerbehebung

Das Modell ignoriert das Bild
Prüfen Sie den Dateipfad und ob die Datei von dort aus zugänglich ist, wo Ollama läuft. Bei Verwendung der API muss das Bild Base64-kodiert im Feld images stehen.
OCR fehlerhaft oder unvollständig
Das Bild ist wahrscheinlich zu stark komprimiert oder hat eine zu niedrige Auflösung. Stellen Sie eine scharfe, größere Version bereit und verlangen Sie ausdrücklich eine originalgetreue Transkription unter Beibehaltung des Layouts. Probieren Sie mit Transformers downsample_mode 4x aus.
Langsame Antworten
Bei reinem CPU-Betrieb ist das zu erwarten. Bei GPU-Betrieb prüfen Sie mit ollama ps, ob das Modell wegen eines zu großen Kontexts oder eines zu großen Bildes teilweise in den Arbeitsspeicher ausgelagert wird.
Unstrukturierte Ausgabe
Für eine zuverlässige JSON-Ausgabe geben Sie das Schema im Prompt verbindlich vor und verwenden Sie, sofern Ihr Client dies unterstützt, das strukturierte Format von Ollama.
Unerwartete Version
Der Tag minicpm-v ohne Suffix verweist weiterhin auf Version 2.6. Geben Sie ausdrücklich minicpm-v4.6 oder minicpm-v4.5 an, um ein reproduzierbares Verhalten zu erhalten.

#Weiterführende Informationen

FAQ
Welchen Ollama-Tag sollte man für MiniCPM-V installieren?+
Für einen kleinen Rechner: minicpm-v4.6, etwa 1,6 GB und ein Modell mit rund 1,3 Milliarden Parametern. Zum Vergleich mit einem Modell mit 8 Milliarden Parametern: minicpm-v4.5 belegt 6,1 GB. Achtung: Der Tag minicpm-v ohne Suffix lädt weiterhin die Version 2.6. Geben Sie immer die Version an, sonst wissen Sie nicht, was Sie testen.
Ist MiniCPM-V kostenlos, auch für kommerziellen Gebrauch?+
Das Repository gibt an, dass die Gewichte und der Code unter der Apache-2.0-Lizenz stehen, und die Modellkarten der Versionen 4.5 und 4.6 auf Hugging Face enthalten diese Angabe. Apache 2.0 erlaubt die kommerzielle Nutzung. Lesen Sie dennoch die Lizenz der genauen Version, die Sie herunterladen, nochmals durch, da für eine ältere Version andere Bedingungen gegolten haben könnten.
Wie viel VRAM braucht man wirklich?+
Die Tabelle im Repository nennt 4 GB GPU-Speicher für Version 4.6 mit Transformers und 2 GB für deren GGUF-Version auf der CPU; Version 4.5 ist in Ollama 6,1 GB groß. Rechnen Sie den Speicherbedarf für Kontext und Bilder hinzu: Bei weniger als 24 GiB VRAM weist Ollama standardmäßig 4.000 Tokens zu. Überprüfen Sie dies mit ollama ps.
Kann MiniCPM-V den Text der Dokumente korrekt lesen?+
Der Anbieter meldet sehr gute OCR-Ergebnisse, wobei Version 4.5 Bilder mit bis zu 1,8 Millionen Pixeln unterstützt. Dabei handelt es sich um seine eigenen Bewertungen. Wie jedes Vision-Modell kann es einen plausiblen Wert erzeugen, der auf der Seite gar nicht vorkommt: Prüfen Sie kritische Zahlen weiterhin manuell nach oder verwenden Sie für größere Mengen eine spezialisierte OCR-Engine.
Kann es auf einem Smartphone verwendet werden?+
Ja, laut Repository lässt sich MiniCPM-V 4.6 auf iOS, Android und HarmonyOS bereitstellen; der Anpassungscode ist offen zugänglich, und es gibt ein Repository mit Anwendungen. Die veröffentlichten Demonstrationen sind Bildschirmaufzeichnungen. Erwarten Sie einzelne Aufgaben statt eines kontinuierlichen Bildstroms, und messen Sie die Latenz auf Ihrem Gerät.
Erlaubt MiniCPM-o, mit einem Modell in Ollama zu sprechen?+
Nicht laut der Ollama-Modellseite, die für minicpm-o4.5 nur Text und Bilder als Eingabe angibt. Sprachgespräche und gleichzeitiges Audio- und Videostreaming laufen laut Repository über Transformers oder llama.cpp-omni. Das Modell benötigt außerdem deutlich mehr Speicher: 19 GB auf der GPU, 10 GB im GGUF-Format.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.