Mittelstufe 11 Min.Qwen

Qwen3-VL lokal: das Referenzmodell für Bildverarbeitung mit Ollama

Qwen3-VL ist das leistungsstärkste Open-Weight-Vision-Sprachmodell für den lokalen Betrieb im Jahr 2026. Mit Ollama installieren Sie es mit einem einzigen Befehl und senden ihm Bilder, Screenshots oder gescannte Dokumente direkt über das Terminal oder eine Benutzeroberfläche. Dieser Leitfaden behandelt die Auswahl der Variante passend zu Ihrem VRAM, die schrittweise Installation von Qwen3-VL mit Ollama, konkrete Anwendungsfälle (Bildbeschreibung, OCR, Lesen von Tabellen) und eine ehrliche Darstellung der Grenzen gegenüber Cloud-Modellen.

Von Léa B.·Aktualisierung 2026-08-06·Unter Windows, macOS und Linux getestet

#Warum Qwen3-VL lokal?

Ein Vision-Language-Modell (VLM) akzeptiert sowohl Text als auch Bilder als Eingabe. Sie zeigen ihm ein Foto, einen Screenshot oder einen Scan und stellen ihm dazu eine Frage in natürlicher Sprache. Qwen3-VL, entwickelt vom Qwen-Team bei Alibaba, hat sich für diesen Einsatz als Referenz unter den Open-Weight-Modellen etabliert: Es verbindet ein gutes visuelles Verständnis mit robuster mehrsprachiger OCR (einschließlich Französisch) und fundiertem Schlussfolgern über das, was es sieht.

Der Vorteil des lokalen Betriebs ist derselbe wie bei jedem selbst gehosteten LLM, wiegt hier aber noch schwerer: Die Bilder, die Sie analysieren, sind oft sensibel – Screenshots aus dem Arbeitsalltag, Verwaltungsdokumente, Fotos von Rechnungen, Ausweisdokumente. Mit Qwen3-VL auf Ihrem Rechner verlässt nichts Ihre Festplatte. Kein Upload in eine Cloud, kein Kontingent, kein Abonnement.

Datenschutz
Die Bilder bleiben auf Ihrem Rechner. Ideal für Personalunterlagen, medizinische oder juristische Dokumente sowie sämtliche persönlichen Scans.
Keine Nutzungskosten
Keine Kosten pro Bild oder Token. Sie verarbeiten 10 oder 10.000 Screenshots, ohne dass die Rechnung steigt.
Hors-ligne
Sobald das Modell heruntergeladen ist, funktioniert alles ohne Internetverbindung.
Automatisierbar
Die OpenAI-kompatible API von Ollama ermöglicht die skriptgesteuerte Stapelverarbeitung von Bildern in Python oder in der Shell.

#Voraussetzungen und benötigter VRAM

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Ein VLM benötigt mehr Ressourcen als ein gleich großes Textmodell: Zusätzlich zu den Gewichten des Sprachmodells lädt es einen visuellen Encoder und muss die von jedem Foto erzeugten „Bildtokens“ verarbeiten. Ein hochauflösendes Bild kann mehreren Tausend Tokens entsprechen, was während der Inferenz Kontext und Speicher beansprucht. Planen Sie daher zusätzlich zum Speicherbedarf der Modellgewichte eine VRAM-Reserve ein.

Für die Quantisierung Q4_K_M (den besten Kompromiss zwischen Qualität und Speicherbedarf für die meisten Anwendungen) finden Sie hier Richtwerte zum Speicherbedarf je nach Größe des zugrunde liegenden Sprachmodells. Rechnen Sie etwa 1 bis 2 GB für den visuellen Encoder und die Bildverarbeitung hinzu.

Variante ~3-4B
≈ 2–3 GB VRAM. Passt problemlos auf eine RTX 3060 mit 12 GB oder einen Mac der M-Serie mit 16 GB. Der Einstieg in lokale Bildverarbeitung mit KI.
Variante ~7-8B
≈ 5–6 GB VRAM. Komfortabel auf einer RTX 3060/4070 mit 12 GB oder einer RTX 4080 mit 16 GB. Das beste Verhältnis von Qualität zu Ressourcenbedarf für den täglichen Gebrauch.
Variante ~30-32B
≈ 19–20 GB VRAM. Ausgelegt für eine RTX 4090 mit 24 GB, eine professionelle Grafikkarte oder einen Mac mit großzügigem Unified Memory (M4 Pro/Max mit 32 GB und mehr).
i
GPU vs. Mac mit Apple Silicon
Auf dem Mac dient der vereinheitlichte Speicher sowohl als RAM als auch als VRAM: Ein M4 Pro mit 24 GB oder ein M4 Max mit 48 GB kann die großen Varianten ausführen, die nur wenige Consumer-GPUs bewältigen. Auf dem PC zählt der VRAM der GPU — wenn das Modell nicht vollständig hineinpasst, verlagert Ollama einen Teil auf die CPU, und der Durchsatz bricht ein.

Auf der Softwareseite benötigen Sie eine installierte, aktuelle Version von Ollama, die multimodale Eingaben unterstützt (der Daemon lauscht standardmäßig auf http://localhost:11434). Eine Benutzeroberfläche wie Open WebUI oder LM Studio macht das Senden von Bildern komfortabler als über die Kommandozeile, ist aber nicht zwingend erforderlich.

#Die passende Variante entsprechend der VRAM auswählen

Qwen3-VL ist in mehreren Größen verfügbar. Sinnvoll ist es, nicht die größte Variante zu wählen, die Ihr Rechner technisch laden kann, sondern diejenige, die noch Spielraum für den Kontext und die Bildverarbeitung lässt. So treffen Sie die Entscheidung.

  1. 01
    Sie verfügen über 8 bis 12 GB VRAM
    Beginnen Sie mit einer 3–4B-Variante in Q4_K_M. Sie beschreibt ein Bild korrekt, erkennt mittels OCR klar lesbaren Text und antwortet schnell. Das reicht für die meisten einfachen Anwendungen (Beschreibung, Textextraktion).
  2. 02
    Sie verfügen über 12–16 GB VRAM
    Wählen Sie eine 7–8B-Variante in Q4_K_M oder Q5_K_M. Das ist der optimale Kompromiss: deutlich besser bei komplexen Dokumenten, Tabellen und visuellem Schlussfolgern, während die Ausführung flüssig bleibt.
  3. 03
    Sie haben 24 GB VRAM oder einen Mac mit reichlich Speicher
    Eine Variante mit 30–32 Milliarden Parametern in Q4_K_M ermöglicht die beste lokal verfügbare Qualität: zuverlässiges Lesen informationsreicher Dokumente und mehrspaltiger Tabellen sowie differenziertes Schlussfolgern anhand von Diagrammen. Hier wird der Abstand zur Cloud am stärksten verringert.
  4. 04
    Im Zweifel
    Beginnen Sie mit der Variante 7–8B. Wenn die Qualität ausreicht, haben Sie VRAM gespart; wenn sie bei Ihren Dokumenten an ihre Grenzen stößt, wechseln Sie zur nächstgrößeren Variante.
→
Die Quantisierung zählt
Bleiben Sie bei einem VLM bei Q4_K_M oder Q5_K_M. Eine zu niedrige Quantisierung (Q3 und darunter) verschlechtert die OCR und das Lesen kleiner Schriftzeichen deutlich — genau das, was man von einem Vision-Modell verlangt. Wenn Sie bei der Quantisierung unsicher sind, ist eine kleinere Variante in Q4_K_M besser als eine große in Q3.

#Qwen3-VL mit Ollama installieren

Die Installation erfordert nur einen Befehl. Ollama lädt das Modell aus seiner Bibliothek herunter, einschließlich des visuellen Encoders, und macht es für die Inferenz bereit. Ersetzen Sie den Tag durch die gewählte Variante aus dem vorherigen Schritt.

Terminal – installieren und starten
# Télécharger la variante (exemple ~8B ; adaptez le tag à votre VRAM)
ollama pull qwen3-vl:8b

# Lancer une session interactive
ollama run qwen3-vl:8b

# Vérifier ce qui est chargé et sur quel matériel (GPU/CPU)
ollama ps

Sobald Sie sich in der interaktiven Sitzung befinden, senden Sie ein Bild, indem Sie seinen Pfad im Prompt angeben. Ollama erkennt den Dateipfad, kodiert das Bild und fügt es dem Kontext hinzu. Anschließend können Sie beliebig viele Fragen zu diesem Bild stellen.

Ollama-Sitzung — ein Bild analysieren
>>> Décris cette image en détail : /home/moi/captures/dashboard.png

>>> Quel est le chiffre affiché en haut à droite ?

>>> Y a-t-il une alerte visible ? Résume-la.
!
Empfohlener absoluter Pfad
Je nach System wird ein relativer Pfad von Ollama möglicherweise nicht korrekt aufgelöst. Wenn die Fehlermeldung „Datei nicht gefunden“ erscheint, obwohl das Bild existiert, geben Sie den vollständigen absoluten Pfad an. Verwenden Sie unter Windows Escape-Sequenzen oder normale Schrägstriche (C:/Users/...).

#Bilder und Screenshots beschreiben

Das ist der naheliegendste Anwendungsfall. Qwen3-VL beschreibt den Inhalt eines Fotos, identifiziert Objekte, liest Text im Bild und zieht Schlussfolgerungen aus dem, was es sieht. Bei Screenshots – Benutzeroberflächen, Dashboards, Fehlermeldungen – ist es besonders nützlich: Es liest die Benutzeroberfläche, erkennt die Elemente und kann erklären, was angezeigt wird.

Allgemeine Beschreibung
„Was zeigt dieses Bild?“ — Auflistung der Elemente, Stimmung, Kontext. Nützlich zum Taggen oder Sortieren von Fotos.
Screenshots auslesen
Ein Dashboard interpretieren, eine Fehlermeldung abschreiben, eine unbekannte Benutzeroberfläche anhand eines Screenshots erklären.
Gezielte Extraktion
„Wie hoch ist der Gesamtbetrag?“, „Liste die sichtbaren Namen auf“ – das Modell isoliert die angefragte Information, statt alles zu beschreiben.
Folgefragen
Sobald das Bild im Kontext ist, stellen Sie weitere Fragen, ohne es erneut zu senden. Das Modell behält die visuelle Referenz.
→
Ein präziser Prompt ist besser als ein vager Prompt
„Beschreibe das Bild“ liefert eine allgemeine Antwort. „Liste ausschließlich die in diesem Screenshot angezeigten Fehler mit ihrem jeweiligen Code auf“ liefert ein nutzbares Ergebnis. Wie bei einem Text-LLM gilt: Je genauer die Anweisung eingegrenzt ist, desto besser ist die Ausgabe – bei der Bildverarbeitung gilt das umso mehr, da sich das Modell in unnötigen Details verlieren kann.

#Lesen von gescannten Dokumenten und Tabellen

Bei OCR und beim Dokumentenverständnis glänzt Qwen3-VL wirklich und rechtfertigt den Wechsel zu einer Variante mit 7–8B oder mehr. Das Modell transkribiert nicht nur den Text: Es versteht die Struktur (Überschriften, Spalten, Felder), sodass sich Daten aus einer Tabelle oder einem Formular in einem sauberen Format extrahieren lassen.

Gescannte Rechnung oder Quittung
Lieferant, Datum, Netto-/Bruttobetrag und Artikelpositionen extrahieren – und eine direkt nutzbare Ausgabe im JSON-Format anfordern.
Tabelle als Bild
Eine fotografierte Tabelle im Markdown- oder CSV-Format rekonstruieren und dabei Zeilen und Spalten beibehalten.
Handschriftliches Dokument
OCR erkennt gedruckten Text problemlos; bei Handschrift sind die Ergebnisse weniger zuverlässig, aber bei einer gut lesbaren Schrift funktioniert die Erkennung.
Verwaltungsformular
Ausgefüllte Felder und ihre Werte erkennen, einschließlich angekreuzter Kästchen.
Ollama-Sitzung — eine Tabelle in Markdown extrahieren
>>> Voici un tableau scanné : /home/moi/docs/tableau-ventes.png
... Reproduis-le exactement au format Markdown, sans rien ajouter
... ni interpréter. Conserve toutes les colonnes et l'ordre des lignes.
!
Stets die kritischen Werte überprüfen
Keine lokale OCR ist zu 100 % zuverlässig. Bei Beträgen, Referenzen oder Nummern kann eine Ziffer falsch gelesen werden (eine 8 wird für eine 6 gehalten, ein Komma verschoben). Prüfen Sie bei buchhalterischer oder juristischer Verwendung grundsätzlich die extrahierten Werte — das Modell beschleunigt die Dateneingabe, ist aber keine verlässliche Quelle für die Richtigkeit der Angaben.

#Über die API automatisieren

Um Bilder in großen Mengen zu verarbeiten – einen Ordner mit Screenshots zu sortieren oder Daten aus Dutzenden von Rechnungen zu extrahieren –, lassen sich all diese Aufgaben über die Ollama-API per Skript automatisieren. Ollama stellt auf Port 11434 eine OpenAI-kompatible API bereit, wobei das Bild Base64-codiert übertragen wird. Hier ist ein minimales Python-Beispiel.

Python — ein Bild per Skript analysieren
import base64
import requests

with open("facture.png", "rb") as f:
    img_b64 = base64.b64encode(f.read()).decode()

resp = requests.post("http://localhost:11434/api/generate", json={
    "model": "qwen3-vl:8b",
    "prompt": "Extrais fournisseur, date et montant TTC au format JSON.",
    "images": [img_b64],
    "stream": False,
})

print(resp.json()["response"])

Von hier aus können Sie mit einer einfachen Schleife über die Dateien eines Ordners einen ganzen Stapel Bilder verarbeiten und die Ergebnisse zusammenführen. Da die Inferenz lokal erfolgt, gelten keine Anfragelimits: Die einzige Einschränkung ist die Geschwindigkeit Ihrer GPU.

→
Fordern Sie ein strukturiertes Format an
Für die Automatisierung müssen Sie im Prompt immer ein Ausgabeformat (JSON, CSV) festlegen und die erwarteten Schlüssel angeben. So vermeiden Sie das Parsen von freiem Text. Fügen Sie bitte 'Antworte ausschließlich im JSON-Format, ohne Text davor oder danach' hinzu, um die Verarbeitung im Nachgang zu erleichtern.

#Das, was die lokale Vision noch nicht bewältigen kann

Seien wir ehrlich: Qwen3-VL ist im lokalen Betrieb hervorragend, aber zu den besten cloudbasierten Vision-Modellen bestehen weiterhin Unterschiede, und bei manchen Aufgaben müssen Sie Ihre Erwartungen herunterschrauben. Wer diese Grenzen kennt, vermeidet böse Überraschungen.

Kleine Details und geringe Auflösung
Bei einem unscharfen, sehr detailreichen oder niedrig aufgelösten Bild versagt die OCR. Ein sauberer, gut ausgerichteter Scan macht einen großen Unterschied. Das Modell „errät“ nicht, was es nicht klar erkennen kann.
Präzise Zählung
Viele identische Objekte exakt zu zählen („Wie viele Personen sind auf diesem Foto?“), bleibt unzuverlässig, sobald es um mehr als einige wenige Elemente geht. Das ist eine bekannte Einschränkung von VLMs.
Präzises räumliches Schlussfolgern
Exakte relative Positionen, Messungen, präzise Geometrie: Das Modell liefert eine grobe Vorstellung, keine messtechnisch genaue Antwort.
Video und Echtzeit
Ollama verarbeitet Standbilder. Für die Videoanalyse müssen Sie das Video selbst in Einzelbilder zerlegen; ein natives Verständnis zeitlicher Zusammenhänge gibt es nicht.
Visuelle Halluzinationen
Wie jedes LLM kann es behaupten, ein nicht vorhandenes Element zu sehen, besonders wenn Ihre Frage dies nahelegt. Stellen Sie neutrale Fragen, keine Suggestivfragen.
i
Lokal vs. Cloud: die eigentliche Abwägung
Cloud-Vision-Modelle behalten bei den schwierigsten Fällen die Nase vorn (sehr dichte Dokumente, komplexes visuelles Schlussfolgern, Zählen). Doch für 90 % der üblichen Anwendungen — Beschreiben, Text extrahieren, eine klar erkennbare Tabelle lesen — erledigt Qwen3-VL die Arbeit lokal, kostenlos und ohne Ihre Bilder offenzulegen. Ausschlaggebend sind die Sensibilität der Daten und der tatsächliche Schwierigkeitsgrad Ihrer Bilder.

#Fehlerbehebung

„Datei nicht gefunden“ bei einer vorhandenen Bilddatei
Relativer Pfad falsch aufgelöst. Geben Sie den vollständigen absoluten Pfad an. Verwenden Sie unter Windows Schrägstriche (C:/...).
Langsame oder stockende Antwort
Das Modell passt nicht vollständig in den VRAM, und ein Teil läuft auf der CPU. Prüfen Sie dies mit ollama ps; wechseln Sie gegebenenfalls zu einer kleineren Variante oder einer Quantisierung mit geringerem Speicherbedarf.
Schlechte OCR-Ergebnisse
Bild mit zu niedriger Auflösung oder zu aggressive Quantisierung. Stellen Sie einen schärferen Scan bereit und verwenden Sie mindestens Q4_K_M.
Das Modell ignoriert das Bild
Sie haben möglicherweise versehentlich eine Textvariante von Qwen geladen. Stellen Sie sicher, dass der Tag tatsächlich -vl enthält und dass Ihre Ollama-Version multimodale Verarbeitung unterstützt.
Out of memory beim Laden
Der VRAM-Bedarf dieser Variante übersteigt Ihre verfügbare Kapazität. Wechseln Sie zu einer kleineren Modellgröße – denken Sie daran, zusätzlichen Speicher für den visuellen Encoder und die Bildtokens einzuplanen.
Schnelle Diagnose
# Le modèle est-il bien chargé et sur GPU ?
ollama ps

# Lister les modèles vision installés
ollama list

# Tester l'API en local
curl http://localhost:11434/api/tags

#Weiterführende Informationen

Qwen3-VL nutzt denselben Ollama-Stack wie Ihre übrigen lokalen Modelle. Diese Anleitungen ergänzen Ihr Vision-Setup sinnvoll:

Multimodales Vision-LLM lokal: Bilder mit Ollama analysieren
Der Überblick über selbst hostbare VLMs (Qwen-VL, Llama-Vision, Llama 4 Scout), um sie zu vergleichen und nach Ihren Bedürfnissen auszuwählen.
Ollama installieren: Windows, macOS und Linux
Falls Ollama noch nicht eingerichtet ist: der vollständige Installationsleitfaden mit den GPU-Voraussetzungen.
Quantisierung wählen (Q4, Q5, Q8, FP16)
Um den Speicherbedarf Ihrer Qwen3-VL-Variante auf den verfügbaren VRAM abzustimmen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.