MiniCPM lokal (Ollama): das multimodale compact
MiniCPM-V ist die Serie kompakter Vision-Language-Modelle von OpenBMB unter der Apache-2.0-Lizenz. In Ollama lädt der Tag minicpm-v noch die Version 2.6 (8 Milliarden, 5,5 GB), minicpm-v4.5 eine 8-Milliarden-Version mit 6,1 GB und minicpm-v4.6 ein Modell mit etwa 1,3 Milliarden Parametern und 1,6 GB. Beginnen Sie mit der 4.6 auf einem kleinen Gerät und vergleichen Sie dann anhand Ihrer Bilder.
MiniCPM ist die Familie kompakter Modelle von OpenBMB. Dazu gehören Vision-Language-Modelle, die dort laufen sollen, wo große Modelle nicht mehr hinein passen. Die Modellfamilie hat sich stark weiterentwickelt: Die Version, die der bisherige Ollama-Tag lädt, ist nicht mehr die neueste, und inzwischen gibt es ein Modell mit 1,3 Milliarden Parametern. Diese Seite erklärt, welchen Tag Sie installieren sollten, wie aussagekräftig die angekündigten Zahlen sind und wo die OCR eines Allzweckmodells an ihre Grenzen stößt.
#Welche Version von MiniCPM im Jahr 2026 installieren?
MiniCPM-V ist die Serie kompakter Vision-Sprach-Modelle von OpenBMB, entwickelt von THUNLP (Tsinghua-Universität) und ModelBest, deren Gewichte und Code unter der Apache-2.0-Lizenz veröffentlicht werden. In Ollama gibt es drei Tags nebeneinander, die für Verwirrung sorgen. Das Tag minicpm-v ohne Suffix entspricht weiterhin MiniCPM-V 2.6, einem Modell mit 8 Milliarden Parametern, einer Größe von 5,5 GB und einem Kontextfenster von 32K. Das Tag minicpm-v4.5 lädt eine neuere Version mit 8 Milliarden Parametern (6,1 GB, 40K Kontext). Das Tag minicpm-v4.6, das laut dem Projekt-Repository am 25. Juni 2026 in die offizielle Ollama-Bibliothek aufgenommen wurde, hat eine Größe von 1,6 GB bei etwa 1,3 Milliarden Parametern. Um lokale Bildverarbeitung auf einem kleinen Rechner kennenzulernen, beginnen Sie mit 4.6; behalten Sie 4.5 für Vergleiche mit Ihren inhaltsreichen Dokumenten, denn es gibt keine Garantie dafür, dass ein Modell mit 1,3 Milliarden Parametern dicht gesetzten Text genauso gut liest wie eines mit 8 Milliarden.
| Ollama-Tag | Version | Parameter | Herunterladen | Angegebene Kontextlänge | Zusammenfassung |
|---|---|---|---|---|---|
| minicpm-v | MiniCPM-V 2.6 | 8 Milliarden | 5,5 GB | 32K | Version von 2024: mehrere Bilder und Video; diese Version lädt der Tag ohne Suffix |
| minicpm-v4.5 | MiniCPM-V 4.5 | 8 Milliarden | 6,1 GB | 40K | Basiert auf Qwen3-8B und SigLIP2-400M; Video mit hoher Bildrate; der Anbieter gibt 77,0 auf OpenCompass an |
| minicpm-v4.6 | MiniCPM-V 4.6 | etwa 1,3 Milliarden | 1,6 GB | 256K | Am leichtesten und am neuesten; Kompression visueller Tokens; mobile Varianten |
| openbmb/minicpm-o4.5 | MiniCPM-o 4.5 | 9 Milliarden | 6,1 GB | 40K | Omni-Version (Sprache, Echtzeitstreams); der Ollama-Eintrag nennt nur Text und Bilder als Eingaben |
#Was die Serie bietet und was man relativieren muss
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Die Modellreihe strebt das beste Verhältnis zwischen Leistungsfähigkeit und Größe an. Laut dem OpenBMB-Repository erreicht MiniCPM-V 4.5 auf OpenCompass einen Wert von 77,0 und übertrifft mit 8 Milliarden Parametern GPT-4o-latest, Gemini 2.0 Pro und Qwen2.5-VL 72B. Für Version 4.6 nennt das Projekt einen visuellen Encoder mit einem um mehr als 50 % geringeren Rechenaufwand, eine wählbare Kompression der visuellen Tokens (4-fach oder 16-fach) und einen Token-Durchsatz, der etwa 1,5-mal so hoch ist wie der von Qwen3.5-0.8B. Die Ollama-Modellseite desselben Modells nennt einen 2,4-mal so hohen Durchsatz: Beide Zahlen stammen vom Projekt, und auf diesen Seiten wird kein Messprotokoll im Detail beschrieben. Das sind Angaben des Projekts, keine unabhängigen Messungen: Messen Sie die Laufzeiten auf Ihrer eigenen Hardware.
- Kompakt und multimodal
- Text und Bild, mehrere Bilder gleichzeitig und Video. Version 4.5 komprimiert laut Repository bis zu 6 Videobilder in 64 Tokens. Dadurch lassen sich mehr Bilder verarbeiten, ohne zusätzlichen Aufwand für das Sprachmodell.
- Hochauflösende OCR
- Version 4.5 verarbeitet Bilder mit beliebigem Seitenverhältnis und bis zu 1,8 Millionen Pixeln (zum Beispiel 1344 x 1344). Der Anbieter behauptet, dass sie unter den multimodalen Allzweckmodellen bei OCRBench und bei der PDF-Analyse (OmniDocBench) führend ist; Version 4.6 soll bei mehreren Benchmarks, darunter OCRBench, das Niveau von Qwen3.5 2B erreichen.
- Permissive Lizenz
- Das Repository gibt an, dass die Gewichte und der Code unter der Apache-2.0-Lizenz stehen. Auch die Modellkarten auf Hugging Face für die Versionen 4.5 und 4.6 enthalten dieselbe Angabe. Prüfen Sie die genaue Lizenz der konkreten Version, die Sie herunterladen.
- Viele Formate
- Das Projekt bietet GGUF-, BNB-, AWQ- und GPTQ-Varianten an und gibt an, mit SGLang, vLLM, llama.cpp und Ollama kompatibel zu sein.
#Wie viel Speicher wirklich benötigt wird
| Modell und Format | Angegebener Speicherbedarf | Quelle |
|---|---|---|
| MiniCPM-V 4.6, Transformers (GPU) | 4 GB | Tabelle der Modelle im Repository |
| MiniCPM-V 4.6, GGUF (CPU) | 2 GB | Tabelle der Modelle im Repository |
| MiniCPM-V 4.6, BNB, AWQ oder GPTQ (GPU) | 3 GB | Tabelle der Modelle im Repository |
| MiniCPM-o 4.5, GGUF | 10 GB | Tabelle der Modelle im Repository |
| MiniCPM-o 4.5, GPU | 19 GB | Tabelle der Modelle im Repository |
| minicpm-v4.6 in Ollama | 1,6 GB Download | Ollama-Eintrag |
| minicpm-v4.5 in Ollama | 6,1 GB Download | Ollama-Eintrag |
Diese Zahlen beschreiben die Modellgewichte und die grundlegende Ausführung: Kontext und Bilder benötigen zusätzlichen Speicher. Bilder werden in visuelle Tokens umgewandelt, die Platz im Kontextfenster belegen. Laut Ollamas Dokumentation verwendet Ollama bei weniger als 24 GiB VRAM standardmäßig 4.000 Kontexttokens; ein höherer Wert erhöht den Speicherbedarf. Der für Version 4.6 angegebene Kontext von 256K wird daher nicht automatisch reserviert. Schließlich weist die Tabelle im Repository für die GGUF-Version von 4.6 eine Ausführung auf der CPU aus, ohne eine Geschwindigkeit anzugeben: Messen Sie diese, bevor Sie Echtzeitbetrieb versprechen.
#MiniCPM-V mit Ollama installieren
Ollama übernimmt den Download, den visuellen Projektor und den API-Server: Sie müssen nichts Weiteres installieren. Aktualisieren Sie zunächst Ollama, da Version 4.6 erst seit Kurzem in der Bibliothek verfügbar ist. Die Seite zum Tag minicpm-v weist bereits darauf hin, dass dafür Ollama 0.3.10 oder höher erforderlich war.
- 01Modell herunterladenollama pull minicpm-v4.6 récupère les poids du modèle de langage et le projecteur visuel, soit environ 1,6 Go. Pour le 4.5, utilisez minicpm-v4.5 (6,1 Go).
- 02Ersten Chat startenollama run minicpm-v4.6 ouvre une session interactive. Posez une question texte avant de tester la vision.
- 03Bild sendenDie Ollama-Dokumentation zeigt, dass der Dateipfad vor der Frage steht, zum Beispiel ollama run minicpm-v4.6 ./photo.jpg gefolgt von „Beschreibe dieses Bild“.
- 04Eine Oberfläche anbindenSobald das Modell heruntergeladen wurde, erscheint es in Open WebUI oder in jedem Client, der auf Port 11434 zugreift.
#Bildverarbeitung und OCR im Alltag
MiniCPM-V eignet sich gut für dokumentenbezogene Aufgaben: eine Rechnung lesen, einen Screenshot transkribieren, die Zeilen einer Tabelle extrahieren oder ein Foto beschreiben. Hochauflösende Bilder sind für OCR besonders wichtig, weil feine Schrift, die auf einem Vorschaubild unleserlich ist, bei voller Auflösung auswertbar wird. Formulieren Sie präzise Prompts: „Beschreibe dieses Bild“ liefert eine allgemeine Beschreibung, während „Transkribiere den gesamten sichtbaren Text originalgetreu und behalte das Layout bei“ ein deutlich saubereres Ergebnis liefert. Geben Sie für die Datenextraktion ein ausdrückliches Format vor: JSON, Markdown oder eine Tabelle.
Die REST-API von Ollama erwartet das Bild base64-codiert im Feld images, wie auch die Dokumentation erläutert; die SDKs akzeptieren zusätzlich einen Dateipfad. Wenn Sie Transformers statt Ollama verwenden, dokumentiert das Repository eine nützliche Einstellung für Version 4.6: Der Parameter downsample_mode hat standardmäßig den Wert 16x, und 4x behält viermal so viele visuelle Tokens bei, um feinere Details zu erfassen. Diese Einstellung sollten Sie ausprobieren, wenn sehr klein geschriebener Text schlecht erkannt wird.
Wann sollten Sie eine spezialisierte OCR-Engine bevorzugen? Wenn Sie Tausende von Seiten verarbeiten und Nachvollziehbarkeit Vorrang hat, erzeugt eine spezialisierte Engine sichtbare Fehler statt plausibler Werte. PaddleOCR-VL, ein Modell mit weniger als einer Milliarde Parametern, erreicht laut seinem Anbieter 96,33 % auf OmniDocBench v1.6, und Tesseract bleibt die schlanke Wahl für sauberen Text. MiniCPM-V behält den Vorteil, wenn Sie auch das Bild beschreiben oder eine Frage dazu beantworten möchten.
- PaddleOCR: die OCR, die die Seite versteht
- Tesseract OCR: Scans lokal lesen
- Rechnungsdaten extrahieren: von Anfang bis Ende
#Im Vergleich zu Qwen3-VL und anderen kompakten Modellen
Der direkte Konkurrent von MiniCPM-V in der Kategorie der kompakten Vision-Modelle ist Qwen3-VL, das in Ollama insbesondere in Versionen mit 2, 4 und 8 Milliarden Parametern verfügbar ist. Beide decken denselben Bereich ab: Bildbeschreibung, OCR und Fragen zu einem Dokument. In der README von OpenBMB wird behauptet, dass MiniCPM-V 4.6 das größere Modell Gemma4-E2B-it in der Leistung übertrifft und effizienter als Qwen3.5-0.8B ist: Diese Vergleiche wurden vom Herausgeber veröffentlicht und beruhen auf seinen eigenen Evaluationen.
| Modell | Angezeigte Größe | Das können wir dazu sagen | Leitfaden auf dieser Website |
|---|---|---|---|
| minicpm-v4.6 | 1,6 GB | Laut Anbieter liegt es bei mehreren visuellen Benchmarks, darunter OCRBench, auf dem Niveau von Qwen3.5 2B | Diese Seite |
| qwen3-vl:2b | 1,9 GB | Gleiche Größenklasse, angegebene Kontextlänge von 256K | Qwen3-VL lokal |
| qwen3-vl:8b | 6,1 GB | Gleiches Dateivolumen wie minicpm-v4.5 | Qwen3-VL lokal |
| Moondream | Anleitung ansehen | Leichtes Vision-Modell, behandelt in einem separaten Leitfaden auf der Website | Moondream |
Für die Wahl sind Ihre Bilder wichtiger als ein Datenblatt. Beide Modellfamilien laufen mit demselben Ollama und derselben API: Um von einer zur anderen zu wechseln, müssen Sie lediglich den Modellnamen in der Anfrage ändern. Nichts spricht dagegen, beide zu behalten und die Anfragen je nach Aufgabe an das passende Modell weiterzuleiten.
#Edge, Mobilgeräte und Server: Was das Projekt dokumentiert
MiniCPM wurde für den Einsatz auf dem Gerät entwickelt. Das Repository gibt an, dass MiniCPM-V 4.6 auf iOS, Android und HarmonyOS bereitgestellt werden kann, wobei der Anpassungscode offen zugänglich ist, und zeigt unbearbeitete Bildschirmaufzeichnungen auf einem iPhone 17 Pro Max, einem Redmi K70 und einem HUAWEI nova 14. Ein Anwendungsrepository bietet den Download und die Bereitstellungsanleitung. Für die Bedienung mehrerer Nutzer kündigt das Projekt neben llama.cpp und Ollama auch Kompatibilität mit vLLM und SGLang an.
- 01Lokale Digitalisierung von DokumentenEin Mini-PC oder ein NAS mit einer Einsteiger-GPU verwandelt einen Ordner mit Scans in durchsuchbaren Text, ohne ein sensibles Dokument in die Cloud zu senden.
- 02Offline-AssistentAuf einem Laptop mit Apple Silicon oder einer einfachen Grafikkarte liest Version 4.6 den Bildschirminhalt und beantwortet Fragen zu Screenshots, auch ohne Internetverbindung.
- 03Vorverarbeitung in einer PipelineAls Vorstufe eines aufwendigeren Systems übernimmt es die Vorsortierung: Dokumenttyp, eindeutig erkennbare Felder. Nur die schwierigen Fälle werden an ein großes Modell weitergeleitet.
- 04Alternativtexte in großen MengenBildbeschreibungen für eine Website oder eine Mediathek stapelweise generieren, ohne Kosten pro Aufruf, sobald sich die Hardware amortisiert hat.
- SGLang: Ein lokales LLM für mehrere Benutzer bereitstellen
- vLLM: Was ist das, für wen eignet es sich und wann sollte man es nutzen?
#Fehlerbehebung
- Das Modell ignoriert das Bild
- Prüfen Sie den Dateipfad und ob die Datei von dort aus zugänglich ist, wo Ollama läuft. Bei Verwendung der API muss das Bild Base64-kodiert im Feld images stehen.
- OCR fehlerhaft oder unvollständig
- Das Bild ist wahrscheinlich zu stark komprimiert oder hat eine zu niedrige Auflösung. Stellen Sie eine scharfe, größere Version bereit und verlangen Sie ausdrücklich eine originalgetreue Transkription unter Beibehaltung des Layouts. Probieren Sie mit Transformers downsample_mode 4x aus.
- Langsame Antworten
- Bei reinem CPU-Betrieb ist das zu erwarten. Bei GPU-Betrieb prüfen Sie mit ollama ps, ob das Modell wegen eines zu großen Kontexts oder eines zu großen Bildes teilweise in den Arbeitsspeicher ausgelagert wird.
- Unstrukturierte Ausgabe
- Für eine zuverlässige JSON-Ausgabe geben Sie das Schema im Prompt verbindlich vor und verwenden Sie, sofern Ihr Client dies unterstützt, das strukturierte Format von Ollama.
- Unerwartete Version
- Der Tag minicpm-v ohne Suffix verweist weiterhin auf Version 2.6. Geben Sie ausdrücklich minicpm-v4.6 oder minicpm-v4.5 an, um ein reproduzierbares Verhalten zu erhalten.
#Weiterführende Informationen
- Ollama in 5 Minuten installieren
- Multimodales LLM mit Bildverarbeitung lokal mit Ollama
- Quantisierung wählen
- Open WebUI mit Ollama
- Quelle: offizielles MiniCPM-V-Repository von OpenBMB
- Quelle: Ollama-Modellseite zu minicpm-v4.6
- Quelle: Modellkarte von MiniCPM-V 4.6 auf Hugging Face
- Quelle: Ollama-Dokumentation zu Vision
Welchen Ollama-Tag sollte man für MiniCPM-V installieren?+
Ist MiniCPM-V kostenlos, auch für kommerziellen Gebrauch?+
Wie viel VRAM braucht man wirklich?+
Kann MiniCPM-V den Text der Dokumente korrekt lesen?+
Kann es auf einem Smartphone verwendet werden?+
Erlaubt MiniCPM-o, mit einem Modell in Ollama zu sprechen?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.