Moondream: das Vision-Modell, das Platz findet partout
Moondream ist eine Familie offener Vision-Sprach-Modelle, die Bilder beschreiben, Fragen beantworten sowie Objekte erkennen, markieren und segmentieren. Moondream 2 (1,9 Milliarden Parameter, Apache 2.0) benötigt in int4 etwa 2 GB VRAM; die Version 0,5B benötigt 816 MiB. Die Generationen 3 und 3.1 (insgesamt 9 Milliarden Parameter, davon 2 aktiv) benötigen etwa 10 GB VRAM. Ihre Lizenz verbietet nur, Moondream selbst als gehosteten Dienst weiterzuverkaufen.
Beeindruckende multimodale Modelle belegen mehrere Dutzend Gigabyte und beanspruchen eine ganze Grafikkarte. Moondream geht das Problem vom anderen Ende an: eine Familie kompakter Vision-Modelle, deren kleinste Version mit weniger als einem Gigabyte auskommt, um auf einem gewöhnlichen Computer ein Bild zu beschreiben, eine Frage zu beantworten oder ein Objekt zu lokalisieren. Dieser Leitfaden mit Stand vom 28. September 2026 unterscheidet die vier Varianten, beziffert ihren Ressourcenverbrauch anhand der Angaben ihres Herausgebers, erklärt die Lizenzen und zeigt, was man von Moondream nicht verlangen sollte.
#Eine Familie, kein Modell
Moondream wird von M87 Labs veröffentlicht. Sein ursprünglicher Autor, Vikhyat Korrapati, beschreibt es im GitHub-Repository als „a tiny vision language model that kicks ass and runs anywhere“. Der Name Moondream bezeichnet heute vier Varianten mit sehr unterschiedlichen Eigenschaften, die ältere Anleitungen oft verwechseln.
| Variante | Architektur | Modellgewichte und Speicher | Kontext | Lizenz |
|---|---|---|---|---|
| Moondream 2 (0,5B) | 500 Millionen Parameter, konzipiert als Ziel für die Distillation für eingebettete Anwendungen | int4: 375 MiB Downloadgröße, 816 MiB Speicherbedarf | Nicht angegeben | Apache 2.0 für das Code-Repository (Modelllizenz nicht angegeben) |
| Moondream 2 | Dichtes Modell, 1,9 Milliarden Parameter, aktualisiert seit März 2024 | Dateigröße 3,85 GB; int8: 2.624 MiB VRAM; int4: 2.002 MiB | 2.000 Tokens | Apache 2.0 |
| Moondream 3 Preview | Mixture of Experts, insgesamt 9 Milliarden Parameter, 2 Milliarden aktive Parameter pro Token; 64 Experten, davon 8 aktiviert | Etwa 18,5 GB in BF16, oder 10,51 GB in FP8 | 32.000 Tokens | Business Source License 1.1 mit Klausel „No Third-Party Service“ |
| Moondream 3.1 9B A2B | Mischung von Experten, insgesamt 9,0 Milliarden, 2,0 aktive; 8 Experten, 2 aktiv, 1 geteilt | Experten in FP8, mindestens 10 GB VRAM laut Modellkarte | 32.768 Tokens | Moondream Model License 1.0, in Kraft seit dem 7. Juli 2026 |
Die Skalierungsdifferenz verändert die Anwendungsmöglichkeiten. Ein Modell mit 2 Milliarden Parametern lädt sich auf einem Laptop ohne Grafikkarte oder auf einem eingebauten Gerät. Ein Modell mit insgesamt 9 Milliarden Parametern, das nur 2 pro Token aktiviert, muss alle Gewichte in der Speicherung halten: Deshalb erfordert die Generation 3 eine Dutzend Gigabyte, wobei die FP8-Vorversion eine Datei von 10,51 GB beträgt. Die Dokumentation von Moondream erklärt, dass ein Mac mini M4 mit Standardausstattung und 16 GB Speicher Moondream 2 aufnehmen kann, jedoch die Gewichte von Moondream 3 die einheitliche Speicherung überschreiten.
#Was es kann
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
Die Moondream-Modelle bieten native Fähigkeiten mit strukturierten Ausgaben statt frei formuliertem Text, der erst interpretiert werden muss. Laut der Modellbeschreibung für Version 3.1 hat jede dieser Fähigkeiten einen fest definierten Ausgabekontrakt.
- Query (eine Frage beantworten)
- Frage in natürlicher Sprache zum Bild, freie Antwort. Das ist der allgemeine Einstieg. Die Modellbeschreibung weist darauf hin, dass keine kalibrierte Konfidenz angegeben wird: Formulieren Sie überprüfbare Fragen.
- Caption (beschreiben)
- Bildbeschreibung in drei Längen: short, normal oder long. Die Modellkarte weist darauf hin, dass eine lange Bildbeschreibung mehr Recall mit einem höheren Halluzinationsrisiko erkauft und dass sie nicht ausgewertet werden darf, um daraus Zählwerte oder Koordinaten abzuleiten.
- Detect (erkennen)
- Begrenzungsrahmen für beliebige Ausdrücke, mit auf Werte zwischen 0 und 1 normierten Koordinaten, ausgehend von der oberen linken Ecke. Bis zu 200 Rahmen pro Aufruf, Standardschwellenwert 0,30.
- Point (auf etwas zeigen)
- Der Mittelpunkt jeder Instanz, bis zu 64 Punkte: ressourcensparender als eine Bounding Box und zum Zählen geeignet.
- Segment (segmentieren)
- Eine Maske pro passendem Objekt, bis zu 50 Instanzen; für die Masken werden keine Konfidenzwerte bereitgestellt.
Moondream 2 hat diese Fähigkeiten schrittweise hinzugewonnen. Das vom Autor veröffentlichte Änderungsprotokoll nennt für März 2025 ausführliche Bildbeschreibungen, die Vergabe von Labels mit offenem Vokabular und eine verbesserte Zählleistung (CountBenchQA von 80 auf 86,4). Im April 2025 verbessert sich das Lesen von Dokumenten und Diagrammen (ChartQA von 74,8 auf 77,5). Im Juni 2025 kommt ein Grounded-Reasoning-Modus hinzu, der mit reasoning=True in der query-Funktion aktiviert wird und Geschwindigkeit zugunsten höherer Genauigkeit opfert, sowie eine laut Autor um 20 bis 40 % schnellere Textgenerierung. Diese Zahlen stammen vom Autor und beruhen auf seinen eigenen Evaluationen: Nutzen Sie sie, um die Entwicklung einzuordnen, nicht für einen Vergleich mit einem anderen Modell.
Ein Hinweis zur Nutzung: Moondream verarbeitet nicht das ganze Bild auf einmal, sondern zerlegt es in Kacheln. Laut seiner FAQ passt es die Bildgröße so an, dass ein Raster aus Kacheln von jeweils etwa 378 × 378 Pixeln das Bild abdeckt, mit höchstens 12 lokalen Kacheln plus einer Gesamtansicht. Das entspricht etwa 1,7 Millionen Pixeln für die lokalen Kacheln. Die Modellkarte der Version 3.1 bestätigt eine adaptive Aufteilung in höchstens 12 Kacheln für PNG-, JPEG- oder WebP-Bilder mit maximal 4.096 Pixeln an der längeren Seite. Ein Foto mit 12 Megapixeln wird daher vor der Analyse stark verkleinert: Um ein Detail zu lesen, schneiden Sie zunächst den betreffenden Bereich zu.
#Was verbraucht es?
| Messung | Moondream 2 (0,5B) | Moondream 2 (1,9B) |
|---|---|---|
| Speicherbedarf zur Laufzeit, int8 | 996 MiB | 2624 MiB |
| Speicherbedarf zur Laufzeit, int4 | 816 MiB | 2002 MiB |
| Herunterladen, int4 | 375 MiB | Nicht angegeben |
| Geschwindigkeit, RTX 3090, int4 mit compile() | Nicht angegeben | 184 Tokens pro Sekunde |
Diese Zahlen stammen von der Modellseite von Moondream: Die Rahmenbedingungen sind wichtig – gemessen wurde auf einer RTX 3090 mit int4 und compile(), und zwar die Textgenerationsgeschwindigkeit, nicht die Zeit pro Bild. Die Zeit pro Bild hängt von der Ausgabegröße und der Anzahl der Bildkacheln ab. Dieselbe Seite gibt an, dass die int4-Quantisierung den Speicherbedarf um 42 % reduziert, bei einem Genauigkeitsverlust von 0,6 %, ohne das Evaluationsverfahren zu nennen; betrachten Sie dies als Aussage des Anbieters.
Für die Generation 3.1 unterstützt die Photon-Engine eine NVIDIA-Grafikkarte der Ampere-Generation oder neuer unter Linux oder Windows oder einen Mac mit Apple Silicon unter macOS 13 oder höher, jeweils mit Python 3.10 bis 3.14. Die Modellbeschreibung nennt außerdem NVIDIA SM75 und höher mit mindestens 10 GB VRAM, eine GGUF-Version für x86- oder ARM-Prozessoren sowie MLX für Apple Silicon. Die Dokumentation führt schließlich auch Jetson-Boards, darunter den Jetson Orin Nano mit 8 GB, als unterstützte Plattformen auf.
#Drei Möglichkeiten zum Starten
- 01Mit der Bibliothek moondream und PhotonInstallieren Sie das Paket und laden Sie dann das Modell: Beim ersten Aufruf werden die Gewichte von Hugging Face heruntergeladen, und laut Dokumentation ist für die Basismodelle kein API-Schlüssel erforderlich. Photon funktioniert nur auf NVIDIA-GPUs der Ampere-Generation oder neuer oder auf Macs mit Apple Silicon.
- 02Mit TransformersDas Repository vikhyatk/moondream2 lässt sich mit AutoModelForCausalLM laden. Geben Sie die Revision an: Der Autor weist darauf hin, dass das Modell häufig aktualisiert wird, und empfiehlt, die Version im Produktivbetrieb festzuschreiben. Die Option trust_remote_code=True führt vom Repository bereitgestellten Code aus: Aktivieren Sie sie nur, wenn Sie der Quelle vertrauen.
- 03Mit OllamaDie Ollama-Seite zu moondream nennt 1,7 GB, einen Kontext von 2 000 Tokens und eine letzte Aktualisierung vor zwei Jahren, also vor den Moondream-2-Versionen von 2025. Die Generationen 3 werden nicht abgedeckt. Prüfen Sie vor dem Einsatz, ob die dort angebotene Version die Fähigkeiten bietet, die Sie benötigen.
Denken Sie daran, dass die Funktion detect normalisierte Koordinaten zurückgibt: Multiplizieren Sie diese mit der Breite und Höhe des ursprünglichen Bildes, um Pixelkoordinaten zu erhalten.
- Überblick über multimodale Modelle für den lokalen Betrieb
- Quelle: die offizielle Dokumentation für die lokale Ausführung
- Quelle: die Modellkarte von Moondream 2 auf Hugging Face
#Anwendungsfälle, in denen es die Nase vorn hat
- 01Eine Fotobibliothek indexierenFür jedes Bild eine Bildbeschreibung erzeugen, um eine Fotosammlung über Text durchsuchbar zu machen. Die Kosten pro Bild entscheiden über die Machbarkeit, und hier hat ein kleines Modell die Nase vorn. Verwenden Sie kurze Bildbeschreibungen: Bei langen besteht die Gefahr, dass Details erfunden werden.
- 02Vor dem großen Modell filternGrob vorsortieren, um nur die Bilder an das kostspielige Modell zu senden, bei denen sich der Einsatz lohnt. Die Fähigkeit point dient zum Zählen, die Fähigkeit detect dazu, automatisch den Bereich zuzuschneiden, der anschließend analysiert werden soll.
- 03Bilder für die Barrierefreiheit beschreibenAlternativtexte für eine bestehende Website stapelweise erstellen, lokal und ohne die Bilder an einen Drittanbieter zu senden. Prüfen Sie eine Stichprobe: Eine Bildbeschreibung bleibt eine Hypothese.
- 04Einen Stream überwachenAuf einem leistungsschwächeren Rechner, der dauerhaft läuft, eine geschlossene Frage zu aufeinanderfolgenden Bildern stellen. Das 0,5B-Modell ist für die Feinabstimmung auf eine eng umrissene Aufgabe ausgelegt, was laut M87 Labs seine Genauigkeit deutlich verbessert.
Eine gute Praxis ergibt sich aus der Beschreibung der Version 3.1: Stellen Sie präzise und geschlossene Fragen. Ein kleiner Modell beantwortet gut die Frage „Ist ein Kopfbedeckung auf dem Kopf der Person?“ und verstreut sich bei „Analysiere diese Szene“.
#Was Sie vom Modell nicht verlangen sollten
Die Modellbeschreibung der Version 3.1 widmet ihren Grenzen einen ganzen Abschnitt, was selten und wertvoll ist. Sie beschreibt die häufigsten Fehler bei der Evaluierung, und die darin angegebenen Schwellenwerte dienen als Orientierung für Modelle derselben Familie.
- Kleine Schrift
- Text, der bei der Auflösung der Bildkachel kleiner als etwa 10 Pixel ist, wird oft falsch gelesen oder ignoriert: Schneiden Sie zuerst den betreffenden Bereich zu und vergrößern Sie ihn.
- Kleine Objekte
- Objekte mit weniger als 12 Pixeln auf der längeren Seite werden von detect nicht erkannt: Verwenden Sie point auf einem zugeschnittenen Bildbereich.
- Detailreiche Szenen
- Ab etwa 50 Instanzen fällt der Recall ab und benachbarte identische Objekte verschmelzen. Zählungen über 50 sind wenig zuverlässig.
- Unsichere Texterkennung
- Bei unscharfem, stilisiertem oder teilweise verdecktem Text kann das Modell eine plausible, aber falsche Zeichenfolge ausgeben, ohne auf eine geringe Konfidenz hinzuweisen. Für ein ganzes Dokument ist eine OCR-Engine zuverlässiger.
- Kritische Anwendungen
- Medizinische Interpretationen sowie rechtliche oder finanzielle Entscheidungen auf Grundlage von Dokumenten ohne menschliche Prüfung werden ausdrücklich vom Anwendungsbereich ausgeschlossen. Die Ausgabe eines kleinen Modells muss überprüft werden.
- Um ein gescanntes Dokument zu lesen, ist die OCR erforderlich
- Qwen VL: lokale Bildanalyse der Spitzenklasse
#Lizenzen: Was Sie tun dürfen
| Modell | Lizenz | Was sie ermöglicht, zusammengefasst |
|---|---|---|
| Moondream 2 | Apache 2.0 | Freie Nutzung, auch kommerziell, unter den üblichen Bedingungen von Apache 2.0 |
| Moondream 3 Preview | Business Source License 1.1 mit Klausel „No Third-Party Service“ | Persönliche Nutzung, Forschung und die meisten kommerziellen Anwendungen; keine kostenpflichtigen Angebote, die mit M87 Labs konkurrieren, einschließlich eines gehosteten Zugangs oder eines kostenpflichtigen SDK, das die Gewichte enthält |
| Moondream 3.1 | Moondream Model License 1.0, source-available, am 7. Juli 2026 gültig | Kommerzieller Einsatz, Fine-Tuning, Quantisierung und Weiterverteilung erlaubt; eine separate Lizenz ist erforderlich, um Moondream selbst als allgemeinen gehosteten Dienst anzubieten |
Wenn Sie Ihre eigene Fotobibliothek indexieren oder die Bilder Ihrer Website beschreiben möchten, stellt keine dieser Lizenzen ein Problem dar: Die interne Nutzung oder der Einsatz als Produktbaustein ist erlaubt. Die Einschränkung betrifft nur diejenigen, die den Zugang zu Moondream selbst verkaufen möchten, etwa über eine gehostete allgemeine Vision-API. Bei Zweifeln an einer kommerziellen Nutzung ist die Lizenz maßgeblich, nicht diese Zusammenfassung.
#Moondream oder ein großes Vision-Modell
Die Frage, die Sie sich stellen sollten, lautet nicht „Welches Modell ist das beste?“, sondern „Wie viele Bilder und für welche Entscheidung?“. Eine Handvoll Bilder pro Tag und offene Fragen: Wählen Sie das größte Modell, das auf Ihrer Grafikkarte läuft. Tausende Bilder und immer wieder dieselbe geschlossene Frage: Ein kleines Modell macht das Projekt möglich.
Eine Kaskadenarchitektur kombiniert beides: Das kleine Modell verarbeitet alles und markiert die interessanten Fälle, das große Modell kommt nur bei diesen zum Einsatz. Bei einem großen Bestand bietet dieses Verfahren das beste Verhältnis zwischen Qualität und Rechenzeit. Moondreams Fähigkeit zur Objekterkennung dient dabei als Filter: Sie schneidet den Bildbereich mit dem Objekt zu, und das große Modell analysiert diesen Ausschnitt.
- Lokale multimodale Modelle mit Ollama
- Qwen3-VL lokal
- PaddleOCR: die OCR, die die Seite versteht
- Quelle: das GitHub-Repository von Moondream
- Quelle: Seite der Moondream-Modelle
#FAQ
Ist Moondream kostenlos?+
Braucht man eine Grafikkarte?+
Kann es ein gescanntes Dokument lesen?+
Moondream oder ein größeres Vision-Modell?+
Kann man es auf viele Bilder nacheinander anwenden?+
Lässt sich das Modell für eine bestimmte Aufgabe feinabstimmen?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.