Mittelstufe 12 Min.Vision

Moondream: das Vision-Modell, das Platz findet partout

Direkte Antwort

Moondream ist eine Familie offener Vision-Sprach-Modelle, die Bilder beschreiben, Fragen beantworten sowie Objekte erkennen, markieren und segmentieren. Moondream 2 (1,9 Milliarden Parameter, Apache 2.0) benötigt in int4 etwa 2 GB VRAM; die Version 0,5B benötigt 816 MiB. Die Generationen 3 und 3.1 (insgesamt 9 Milliarden Parameter, davon 2 aktiv) benötigen etwa 10 GB VRAM. Ihre Lizenz verbietet nur, Moondream selbst als gehosteten Dienst weiterzuverkaufen.

Beeindruckende multimodale Modelle belegen mehrere Dutzend Gigabyte und beanspruchen eine ganze Grafikkarte. Moondream geht das Problem vom anderen Ende an: eine Familie kompakter Vision-Modelle, deren kleinste Version mit weniger als einem Gigabyte auskommt, um auf einem gewöhnlichen Computer ein Bild zu beschreiben, eine Frage zu beantworten oder ein Objekt zu lokalisieren. Dieser Leitfaden mit Stand vom 28. September 2026 unterscheidet die vier Varianten, beziffert ihren Ressourcenverbrauch anhand der Angaben ihres Herausgebers, erklärt die Lizenzen und zeigt, was man von Moondream nicht verlangen sollte.

Von Mohamed Meguedmi·Aktualisierung 2026-09-29·Unter Windows, macOS und Linux getestet

#Eine Familie, kein Modell

Moondream wird von M87 Labs veröffentlicht. Sein ursprünglicher Autor, Vikhyat Korrapati, beschreibt es im GitHub-Repository als „a tiny vision language model that kicks ass and runs anywhere“. Der Name Moondream bezeichnet heute vier Varianten mit sehr unterschiedlichen Eigenschaften, die ältere Anleitungen oft verwechseln.

Die Varianten von Moondream, gemäß M87 Labs und Hugging Face
VarianteArchitekturModellgewichte und SpeicherKontextLizenz
Moondream 2 (0,5B)500 Millionen Parameter, konzipiert als Ziel für die Distillation für eingebettete Anwendungenint4: 375 MiB Downloadgröße, 816 MiB SpeicherbedarfNicht angegebenApache 2.0 für das Code-Repository (Modelllizenz nicht angegeben)
Moondream 2Dichtes Modell, 1,9 Milliarden Parameter, aktualisiert seit März 2024Dateigröße 3,85 GB; int8: 2.624 MiB VRAM; int4: 2.002 MiB2.000 TokensApache 2.0
Moondream 3 PreviewMixture of Experts, insgesamt 9 Milliarden Parameter, 2 Milliarden aktive Parameter pro Token; 64 Experten, davon 8 aktiviertEtwa 18,5 GB in BF16, oder 10,51 GB in FP832.000 TokensBusiness Source License 1.1 mit Klausel „No Third-Party Service“
Moondream 3.1 9B A2BMischung von Experten, insgesamt 9,0 Milliarden, 2,0 aktive; 8 Experten, 2 aktiv, 1 geteiltExperten in FP8, mindestens 10 GB VRAM laut Modellkarte32.768 TokensMoondream Model License 1.0, in Kraft seit dem 7. Juli 2026

Die Skalierungsdifferenz verändert die Anwendungsmöglichkeiten. Ein Modell mit 2 Milliarden Parametern lädt sich auf einem Laptop ohne Grafikkarte oder auf einem eingebauten Gerät. Ein Modell mit insgesamt 9 Milliarden Parametern, das nur 2 pro Token aktiviert, muss alle Gewichte in der Speicherung halten: Deshalb erfordert die Generation 3 eine Dutzend Gigabyte, wobei die FP8-Vorversion eine Datei von 10,51 GB beträgt. Die Dokumentation von Moondream erklärt, dass ein Mac mini M4 mit Standardausstattung und 16 GB Speicher Moondream 2 aufnehmen kann, jedoch die Gewichte von Moondream 3 die einheitliche Speicherung überschreiten.

i
Warnung bezüglich der Version 3.1
Die Modellbeschreibung der Version 3.1 kennzeichnet ihre Benchmark-Zahlen als „PRELIMINARY“; diese können sich vor der öffentlichen Veröffentlichung noch ändern. Dieser Leitfaden übernimmt daher keinen dieser Werte. Die weiter unten genannten Speicherangaben stammen aus der technischen Dokumentation und den veröffentlichten Dateigrößen.

#Was es kann

Das Kit Lokale KI

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Die Moondream-Modelle bieten native Fähigkeiten mit strukturierten Ausgaben statt frei formuliertem Text, der erst interpretiert werden muss. Laut der Modellbeschreibung für Version 3.1 hat jede dieser Fähigkeiten einen fest definierten Ausgabekontrakt.

Query (eine Frage beantworten)
Frage in natürlicher Sprache zum Bild, freie Antwort. Das ist der allgemeine Einstieg. Die Modellbeschreibung weist darauf hin, dass keine kalibrierte Konfidenz angegeben wird: Formulieren Sie überprüfbare Fragen.
Caption (beschreiben)
Bildbeschreibung in drei Längen: short, normal oder long. Die Modellkarte weist darauf hin, dass eine lange Bildbeschreibung mehr Recall mit einem höheren Halluzinationsrisiko erkauft und dass sie nicht ausgewertet werden darf, um daraus Zählwerte oder Koordinaten abzuleiten.
Detect (erkennen)
Begrenzungsrahmen für beliebige Ausdrücke, mit auf Werte zwischen 0 und 1 normierten Koordinaten, ausgehend von der oberen linken Ecke. Bis zu 200 Rahmen pro Aufruf, Standardschwellenwert 0,30.
Point (auf etwas zeigen)
Der Mittelpunkt jeder Instanz, bis zu 64 Punkte: ressourcensparender als eine Bounding Box und zum Zählen geeignet.
Segment (segmentieren)
Eine Maske pro passendem Objekt, bis zu 50 Instanzen; für die Masken werden keine Konfidenzwerte bereitgestellt.

Moondream 2 hat diese Fähigkeiten schrittweise hinzugewonnen. Das vom Autor veröffentlichte Änderungsprotokoll nennt für März 2025 ausführliche Bildbeschreibungen, die Vergabe von Labels mit offenem Vokabular und eine verbesserte Zählleistung (CountBenchQA von 80 auf 86,4). Im April 2025 verbessert sich das Lesen von Dokumenten und Diagrammen (ChartQA von 74,8 auf 77,5). Im Juni 2025 kommt ein Grounded-Reasoning-Modus hinzu, der mit reasoning=True in der query-Funktion aktiviert wird und Geschwindigkeit zugunsten höherer Genauigkeit opfert, sowie eine laut Autor um 20 bis 40 % schnellere Textgenerierung. Diese Zahlen stammen vom Autor und beruhen auf seinen eigenen Evaluationen: Nutzen Sie sie, um die Entwicklung einzuordnen, nicht für einen Vergleich mit einem anderen Modell.

Ein Hinweis zur Nutzung: Moondream verarbeitet nicht das ganze Bild auf einmal, sondern zerlegt es in Kacheln. Laut seiner FAQ passt es die Bildgröße so an, dass ein Raster aus Kacheln von jeweils etwa 378 × 378 Pixeln das Bild abdeckt, mit höchstens 12 lokalen Kacheln plus einer Gesamtansicht. Das entspricht etwa 1,7 Millionen Pixeln für die lokalen Kacheln. Die Modellkarte der Version 3.1 bestätigt eine adaptive Aufteilung in höchstens 12 Kacheln für PNG-, JPEG- oder WebP-Bilder mit maximal 4.096 Pixeln an der längeren Seite. Ein Foto mit 12 Megapixeln wird daher vor der Analyse stark verkleinert: Um ein Detail zu lesen, schneiden Sie zunächst den betreffenden Bereich zu.

#Was verbraucht es?

Von M87 Labs angegebener Speicherbedarf und angegebene Geschwindigkeit für die kleinen Varianten
MessungMoondream 2 (0,5B)Moondream 2 (1,9B)
Speicherbedarf zur Laufzeit, int8996 MiB2624 MiB
Speicherbedarf zur Laufzeit, int4816 MiB2002 MiB
Herunterladen, int4375 MiBNicht angegeben
Geschwindigkeit, RTX 3090, int4 mit compile()Nicht angegeben184 Tokens pro Sekunde

Diese Zahlen stammen von der Modellseite von Moondream: Die Rahmenbedingungen sind wichtig – gemessen wurde auf einer RTX 3090 mit int4 und compile(), und zwar die Textgenerationsgeschwindigkeit, nicht die Zeit pro Bild. Die Zeit pro Bild hängt von der Ausgabegröße und der Anzahl der Bildkacheln ab. Dieselbe Seite gibt an, dass die int4-Quantisierung den Speicherbedarf um 42 % reduziert, bei einem Genauigkeitsverlust von 0,6 %, ohne das Evaluationsverfahren zu nennen; betrachten Sie dies als Aussage des Anbieters.

Für die Generation 3.1 unterstützt die Photon-Engine eine NVIDIA-Grafikkarte der Ampere-Generation oder neuer unter Linux oder Windows oder einen Mac mit Apple Silicon unter macOS 13 oder höher, jeweils mit Python 3.10 bis 3.14. Die Modellbeschreibung nennt außerdem NVIDIA SM75 und höher mit mindestens 10 GB VRAM, eine GGUF-Version für x86- oder ARM-Prozessoren sowie MLX für Apple Silicon. Die Dokumentation führt schließlich auch Jetson-Boards, darunter den Jetson Orin Nano mit 8 GB, als unterstützte Plattformen auf.

#Drei Möglichkeiten zum Starten

  1. 01
    Mit der Bibliothek moondream und Photon
    Installieren Sie das Paket und laden Sie dann das Modell: Beim ersten Aufruf werden die Gewichte von Hugging Face heruntergeladen, und laut Dokumentation ist für die Basismodelle kein API-Schlüssel erforderlich. Photon funktioniert nur auf NVIDIA-GPUs der Ampere-Generation oder neuer oder auf Macs mit Apple Silicon.
  2. 02
    Mit Transformers
    Das Repository vikhyatk/moondream2 lässt sich mit AutoModelForCausalLM laden. Geben Sie die Revision an: Der Autor weist darauf hin, dass das Modell häufig aktualisiert wird, und empfiehlt, die Version im Produktivbetrieb festzuschreiben. Die Option trust_remote_code=True führt vom Repository bereitgestellten Code aus: Aktivieren Sie sie nur, wenn Sie der Quelle vertrauen.
  3. 03
    Mit Ollama
    Die Ollama-Seite zu moondream nennt 1,7 GB, einen Kontext von 2 000 Tokens und eine letzte Aktualisierung vor zwei Jahren, also vor den Moondream-2-Versionen von 2025. Die Generationen 3 werden nicht abgedeckt. Prüfen Sie vor dem Einsatz, ob die dort angebotene Version die Fähigkeiten bietet, die Sie benötigen.
Python, nach der Dokumentation von Moondream
# pip install --upgrade moondream
import moondream as md
from PIL import Image

model = md.photon("moondream2")   # ou "moondream3.1-9B-A2B" avec une carte de 10 Go ou plus
image = Image.open("photo.jpg")

print(model.caption(image, length="short")["caption"])
print(model.query(image, "Combien de personnes sont visibles ?")["answer"])
for obj in model.detect(image, "casque")["objects"]:
    print(obj)

Denken Sie daran, dass die Funktion detect normalisierte Koordinaten zurückgibt: Multiplizieren Sie diese mit der Breite und Höhe des ursprünglichen Bildes, um Pixelkoordinaten zu erhalten.

#Anwendungsfälle, in denen es die Nase vorn hat

  1. 01
    Eine Fotobibliothek indexieren
    Für jedes Bild eine Bildbeschreibung erzeugen, um eine Fotosammlung über Text durchsuchbar zu machen. Die Kosten pro Bild entscheiden über die Machbarkeit, und hier hat ein kleines Modell die Nase vorn. Verwenden Sie kurze Bildbeschreibungen: Bei langen besteht die Gefahr, dass Details erfunden werden.
  2. 02
    Vor dem großen Modell filtern
    Grob vorsortieren, um nur die Bilder an das kostspielige Modell zu senden, bei denen sich der Einsatz lohnt. Die Fähigkeit point dient zum Zählen, die Fähigkeit detect dazu, automatisch den Bereich zuzuschneiden, der anschließend analysiert werden soll.
  3. 03
    Bilder für die Barrierefreiheit beschreiben
    Alternativtexte für eine bestehende Website stapelweise erstellen, lokal und ohne die Bilder an einen Drittanbieter zu senden. Prüfen Sie eine Stichprobe: Eine Bildbeschreibung bleibt eine Hypothese.
  4. 04
    Einen Stream überwachen
    Auf einem leistungsschwächeren Rechner, der dauerhaft läuft, eine geschlossene Frage zu aufeinanderfolgenden Bildern stellen. Das 0,5B-Modell ist für die Feinabstimmung auf eine eng umrissene Aufgabe ausgelegt, was laut M87 Labs seine Genauigkeit deutlich verbessert.

Eine gute Praxis ergibt sich aus der Beschreibung der Version 3.1: Stellen Sie präzise und geschlossene Fragen. Ein kleiner Modell beantwortet gut die Frage „Ist ein Kopfbedeckung auf dem Kopf der Person?“ und verstreut sich bei „Analysiere diese Szene“.

#Was Sie vom Modell nicht verlangen sollten

Die Modellbeschreibung der Version 3.1 widmet ihren Grenzen einen ganzen Abschnitt, was selten und wertvoll ist. Sie beschreibt die häufigsten Fehler bei der Evaluierung, und die darin angegebenen Schwellenwerte dienen als Orientierung für Modelle derselben Familie.

Kleine Schrift
Text, der bei der Auflösung der Bildkachel kleiner als etwa 10 Pixel ist, wird oft falsch gelesen oder ignoriert: Schneiden Sie zuerst den betreffenden Bereich zu und vergrößern Sie ihn.
Kleine Objekte
Objekte mit weniger als 12 Pixeln auf der längeren Seite werden von detect nicht erkannt: Verwenden Sie point auf einem zugeschnittenen Bildbereich.
Detailreiche Szenen
Ab etwa 50 Instanzen fällt der Recall ab und benachbarte identische Objekte verschmelzen. Zählungen über 50 sind wenig zuverlässig.
Unsichere Texterkennung
Bei unscharfem, stilisiertem oder teilweise verdecktem Text kann das Modell eine plausible, aber falsche Zeichenfolge ausgeben, ohne auf eine geringe Konfidenz hinzuweisen. Für ein ganzes Dokument ist eine OCR-Engine zuverlässiger.
Kritische Anwendungen
Medizinische Interpretationen sowie rechtliche oder finanzielle Entscheidungen auf Grundlage von Dokumenten ohne menschliche Prüfung werden ausdrücklich vom Anwendungsbereich ausgeschlossen. Die Ausgabe eines kleinen Modells muss überprüft werden.

#Lizenzen: Was Sie tun dürfen

Lizenzen der Moondream-Modelle laut ihren Modellbeschreibungen und Lizenztexten
ModellLizenzWas sie ermöglicht, zusammengefasst
Moondream 2Apache 2.0Freie Nutzung, auch kommerziell, unter den üblichen Bedingungen von Apache 2.0
Moondream 3 PreviewBusiness Source License 1.1 mit Klausel „No Third-Party Service“Persönliche Nutzung, Forschung und die meisten kommerziellen Anwendungen; keine kostenpflichtigen Angebote, die mit M87 Labs konkurrieren, einschließlich eines gehosteten Zugangs oder eines kostenpflichtigen SDK, das die Gewichte enthält
Moondream 3.1Moondream Model License 1.0, source-available, am 7. Juli 2026 gültigKommerzieller Einsatz, Fine-Tuning, Quantisierung und Weiterverteilung erlaubt; eine separate Lizenz ist erforderlich, um Moondream selbst als allgemeinen gehosteten Dienst anzubieten

Wenn Sie Ihre eigene Fotobibliothek indexieren oder die Bilder Ihrer Website beschreiben möchten, stellt keine dieser Lizenzen ein Problem dar: Die interne Nutzung oder der Einsatz als Produktbaustein ist erlaubt. Die Einschränkung betrifft nur diejenigen, die den Zugang zu Moondream selbst verkaufen möchten, etwa über eine gehostete allgemeine Vision-API. Bei Zweifeln an einer kommerziellen Nutzung ist die Lizenz maßgeblich, nicht diese Zusammenfassung.

#Moondream oder ein großes Vision-Modell

Die Frage, die Sie sich stellen sollten, lautet nicht „Welches Modell ist das beste?“, sondern „Wie viele Bilder und für welche Entscheidung?“. Eine Handvoll Bilder pro Tag und offene Fragen: Wählen Sie das größte Modell, das auf Ihrer Grafikkarte läuft. Tausende Bilder und immer wieder dieselbe geschlossene Frage: Ein kleines Modell macht das Projekt möglich.

Eine Kaskadenarchitektur kombiniert beides: Das kleine Modell verarbeitet alles und markiert die interessanten Fälle, das große Modell kommt nur bei diesen zum Einsatz. Bei einem großen Bestand bietet dieses Verfahren das beste Verhältnis zwischen Qualität und Rechenzeit. Moondreams Fähigkeit zur Objekterkennung dient dabei als Filter: Sie schneidet den Bildbereich mit dem Objekt zu, und das große Modell analysiert diesen Ausschnitt.

#FAQ

FAQ
Ist Moondream kostenlos?+
Ja, bei lokaler Ausführung. Moondream 2 steht unter der Apache-2.0-Lizenz, die Generationen 3 und 3.1 unter Source-available-Lizenzen, die eine kommerzielle Nutzung erlauben. Bei lokaler Nutzung fallen keine Nutzungskosten an, und für die Basismodelle mit Photon ist kein API-Schlüssel erforderlich. Nur das Angebot eines allgemeinen gehosteten Dienstes auf Basis von Moondream erfordert eine separate kommerzielle Lizenz.
Braucht man eine Grafikkarte?+
Nicht unbedingt für kleine Varianten: Die Version 0,5B gibt 816 MiB Speicher in int4 an, und Moondream 2 läuft laut M87 Labs auf GPU, Prozessor, Mobilgeräten und Raspberry Pi. Die Photon-Engine erfordert hingegen eine NVIDIA-Ampere-Karte oder einen Mac mit Apple Silicon. Für die Generation 3.1 sollten Sie mit mehr als 10 GB VRAM rechnen.
Kann es ein gescanntes Dokument lesen?+
Es liest kurze Texte, Schilder und Etiketten und macht bei Dokumenten Fortschritte. Für eine dicht beschriebene Seite ist eine OCR-Engine jedoch zuverlässiger: Die Modellkarte der Version 3.1 warnt davor, dass das Modell bei unscharfem Text eine plausible, aber falsche Zeichenfolge erzeugen kann, ohne ein Warnsignal auszugeben. Es erfindet nicht weniger Werte als ein großes Modell, und Text unter 10 Pixeln wird oft falsch gelesen.
Moondream oder ein größeres Vision-Modell?+
Für einige Bilder und offene Fragen nehmen Sie das größte Modell, das Ihre Grafikkarte ausführen kann. Für Tausende von Bildern und eine immer wieder gestellte geschlossene Frage macht Moondream das Projekt machbar. Eine Kaskade kombiniert beide Ansätze: Das kleine Modell sortiert die Bilder und schneidet sie zu, das große Modell kommt nur bei interessanten Fällen zum Einsatz.
Kann man es auf viele Bilder nacheinander anwenden?+
Das ist seine Stärke. Die Photon-Engine kündigt automatische Stapelverarbeitung und die Verwaltung eines Präfix-Caches an. Beachten Sie, dass jedes Bild auf etwa 1,7 Millionen Pixel in lokalen Bildkacheln reduziert wird: Schneiden Sie das Bild für feine Details zuerst zu. Testen Sie die Verarbeitung an einer Stichprobe, bevor Sie Tausende von Bildern verarbeiten.
Lässt sich das Modell für eine bestimmte Aufgabe feinabstimmen?+
Ja. Die Lizenz 3.1 erlaubt Fine-Tuning, Quantisierung und Weiterverbreitung, und M87 Labs stellt die Version 0,5B als Grundlage für das Fine-Tuning auf eine eng umrissene Aufgabe vor, mit einem Genauigkeitsgewinn laut Anbieter. Für den üblichen Einsatz beginnen Sie mit dem Basismodell: Fine-Tuning erfordert annotierte Daten und ein Testprotokoll, bevor es seine Kosten rechtfertigt.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.