Llama 4 Scout lokal: Installation und erste Tests mit Ollama
Llama 4 Scout ist das kleinste der drei Modelle aus Metas Llama-4-Familie. Es ist auch das einzige, das lokal auf einer High-End-Workstation Platz findet — Maverick und Behemoth bleiben der Cloud oder dedizierten Servern vorbehalten. Dieser Leitfaden zeigt, wie Sie Llama 4 Scout mit Ollama installieren, wie viel VRAM Sie tatsächlich benötigen (das MoE-Versprechen wird oft missverstanden) und wie Sie seine beiden besonderen Stärken nutzen: native Multimodalität und ein Kontextfenster von 10 Millionen Tokens.
#Warum Llama 4 Scout lokal mit Ollama installieren?
Scout ist das einzige Modell der Llama-4-Reihe, das für den Betrieb auf einem einzigen Rechner konzipiert wurde. Meta hat es als „Workstation-Modell“ der Familie positioniert: von Haus aus multimodal (Text + Bilder), mit einem angekündigten Kontextfenster von 10 Millionen Tokens und einer MoE-Architektur (Mixture of Experts), die bei jedem Token nur einen Bruchteil der Parameter aktiviert.
Im Vergleich zu einem dichten Modell gleicher Größe bietet Scout konkret eine geringere Latenz (wenige aktive Parameter pro Token), einen deutlich größeren Kontextspeicher und integrierte Bildverarbeitung ohne separates Modell. Der Preis dafür: ein erheblicher Speicherbedarf auf dem Datenträger (alle Experten müssen im VRAM geladen bleiben, damit das Routing funktioniert).
#Scout, Maverick, Behemoth: Wer macht was?
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
- Scout (17B aktive Parameter)
- Das Workstation-Modell. 16 Experten, insgesamt ~109 Milliarden Parameter. Multimodal. Kontext: 10 Millionen Tokens. Zielhardware: RTX 4090, M3/M4 Max/Ultra oder ein Multi-GPU-Setup mit mindestens 48 GB.
- Maverick (17B aktive Parameter)
- Das Servermodell. 128 Experten, insgesamt ~400 Milliarden Parameter. Genauso viele aktive Parameter wie Scout, aber deutlich mehr gespeichertes Wissen. Ziel: Server mit 8x H100 oder ein Cluster. Für die meisten Konfigurationen kommt ein lokaler Betrieb nicht infrage.
- Behemoth (288 Milliarden aktive Parameter)
- Das Frontier-Modell. Insgesamt etwa 2 Billionen Parameter. Ohne Rechenzentrum nicht lokal ausführbar. Vor allem als „Lehrermodell“ nützlich, um die beiden anderen zu distillieren.
#Tatsächlicher VRAM-Bedarf: Was das Datenblatt nicht verrät
Der klassische Fehler bei MoE-Modellen besteht darin, nur die aktiven Parameter als Berechnungsgrundlage zu nehmen. „17B aktive Parameter = das passt in Q4 in 12 GB“: falsch. Damit das Routing funktioniert, müssen alle Experten im Speicher bleiben. Scout in Q4_K_M benötigt deutlich mehr Speicher, als seine 17B aktiven Parameter vermuten lassen.
- Q4_K_M (empfohlen)
- ≈ 65 GB VRAM allein für das Modell. Für einen angemessenen Kontext (32k Tokens) zusätzlich ~4 GB einplanen. Insgesamt ≈ 70 GB.
- Q5_K_M
- ≈ 78 GB. Geringer Qualitätsgewinn gegenüber dem Q4_K_M bei der Mehrzahl der Aufgaben.
- Q8_0
- ≈ 115 GB. Referenzbenchmarks vorbehalten.
- FP16
- ≈ 220 GB. Nur in der Cloud oder auf mehreren Servern.
Konfigurationen, auf denen Scout lokal komfortabel läuft:
- Mac Studio M3 Ultra / M5 Ultra mit 96 GB und mehr
- Die beste Plattform für Privatnutzer, um Scout auszuführen. Unified Memory, kein Offloading, ~25–40 Tokens/s je nach Quantisierung.
- 2x RTX 4090 / 2x 5090
- 48 GB oder 64 GB zusammen, ausreichend für Q4_K_M mit erweitertem Kontext. Auf llama.cpp oder Ollama mit der Variablen OLLAMA_NUM_GPU setzen
- Workstation mit RTX 6000 Ada (48 GB) oder A6000
- Bietet problemlos Platz für Scout Q4 und lässt noch Spielraum für den Kontext.
#Voraussetzungen
- Ollama 0.6 oder neuer
- Die Unterstützung für Llama 4 wurde mit Ollama 0.6 eingeführt. Prüfen Sie Ihre Version mit ollama --version und aktualisieren Sie Ollama, falls sie älter ist.
- 70 GB freier Festplattenspeicher
- Das Modell mit dem Tag Q4_K_M ist etwa 65 GB groß. Planen Sie großzügig zusätzlichen Platz für den Cache ein.
- Hohe Speicherbandbreite
- Auf dem Mac: ≥ 400 GB/s anstreben (M3 Max und höher). Auf dem PC: DDR5, wenn CPU-Offload vorgesehen ist.
- Eine stabile Verbindung
- Der erste Download kann 1 bis 3 Stunden dauern, je nach Ihrem Link. ollama pull supporte Die Wiederherstellung im Falle einer Unterbrechung.
#1. Llama 4 Scout mit Ollama installieren
Wenn Ollama noch nicht installiert ist, folgen Sie zunächst der passenden Anleitung für Ihr System. Anschließend lässt sich Scout mit einem einzigen Befehl herunterladen.
Dieser Tag verweist standardmäßig auf die Quantisierung Q4_K_M. Wenn Sie eine andere Variante erzwingen möchten:
Listen Sie nach Abschluss des Downloads die Modelle auf, um die tatsächliche Größe zu überprüfen:
#2. Erster Test: Text und logisches Denken
Starten Sie eine interaktive Sitzung, um die ordnungsgemäße Funktion zu überprüfen, bevor Sie den Rest bearbeiten.
Sobald der Prompt >>> erscheint, überprüfen Sie die Sprache und die Qualität der Schlussfolgerungen mit einem einfachen Test:
Öffnen Sie während des laufenden Gesprächs ein zweites Terminal, um die Auslastung zu beobachten:
Die Spalte SIZE muss die tatsächlich geladene Modellgröße widerspiegeln. Unter PROCESSOR sollte idealerweise 100 % GPU stehen. Wenn Sie eine Mischung aus CPU und GPU sehen, reicht der VRAM nicht aus und Ollama lagert Teile des Modells aus – darunter leidet die Geschwindigkeit erheblich.
#3. Test der Bildverarbeitung auf Französisch
Scout ist von Grund auf multimodal: Bild und Text werden durch dasselbe Backbone verarbeitet, anders als bei einem Ansatz, der einen separaten visuellen Encoder an ein rein textbasiertes Modell anhängt. Das führt zu besseren Ergebnissen bei Aufgaben, die beide Modalitäten kombinieren (kontextbezogene OCR, Lesen von Diagrammen, detaillierte Beschreibungen).
Mit der REST-API von Ollama sendet man das Bild im Base64-Format in das Feld 'images':
Bei typischen Fällen (Screenshot einer Benutzeroberfläche, Foto eines Whiteboards, PDF-Scan) liefert Scout eine detaillierte Beschreibung und bleibt auf Französisch konsistent, auch wenn das Bild englischen Text enthält. Bei strukturierten Details liegt es eine Stufe über einem kleinen, allgemein einsetzbaren Bildverarbeitungsmodell wie Qwen 3.5 9B.
#4. Kontext mit 10M Tokens: Versprechen und Realität
Meta gibt für Scout ein Kontextfenster von 10 Millionen Tokens an. In der Praxis gibt es beim lokalen Betrieb zwei Grenzen.
- Der KV-Cache explodiert
- Bei 1 Million Tokens erhöht der KV-Cache den vom Modell belegten VRAM leicht um 30 bis 50 GB. Darüber hinaus muss die Quantisierung des KV-Caches aktiviert werden (Option num_ctx plus experimentelle Parameter), oder man muss sich mit einem CPU-Offload des Caches abfinden.
- Die Qualität sinkt bereits weit vor 10M
- Unabhängige Benchmarks (RULER, NoLiMa) zeigen trotz des Trainings mit langen Kontexten einen Einbruch der praktisch nutzbaren Leistung bei etwa 256k–512k Tokens. Darüber hinaus ist es technisch möglich, aber wenig zuverlässig.
Um einen erweiterten Kontext zu nutzen, ohne dass alles abstürzt, konfigurieren Sie Ollama über ein Modelfile:
#Scout vs Qwen3-30B-A3B: der echte Vergleich
Qwen3-30B-A3B ist das andere MoE-Modell, das 2026 ernsthaft für den lokalen Einsatz in Betracht kommt: 30 Milliarden Parameter insgesamt, 3 Milliarden aktive Parameter, ein nativer Kontext von 256k Tokens. Der Vergleich lohnt sich, denn die beiden Modelle spielen hinsichtlich ihrer Hardwareanforderungen nicht in derselben Liga.
- VRAM-Bedarf bei Q4
- Scout ≈ 65 GB. Qwen3-30B-A3B ≈ 18 GB. Der Unterschied ist enorm und verändert die Anforderungen an den Zielrechner grundlegend.
- Generationsgeschwindigkeit
- Bei vergleichbarer Anzahl aktiver Parameter (17B vs. 3B) ist Qwen3-30B-A3B in Tokens/s schneller – typischerweise 2–3-mal so schnell auf derselben Maschine, wenn beide Modelle in den Speicher passen.
- Qualität des Schlussfolgerns
- In den öffentlichen Benchmarks MMLU-Pro und GPQA liegt Scout weiterhin vor Qwen3-30B-A3B. Der Abstand verringert sich erheblich, wenn der Thinking-Modus von Qwen3 aktiviert ist.
- Multimodalität
- Scout ist von Haus aus multimodal. Qwen3-30B-A3B ist es nicht – wenn Sie Bildverarbeitung im selben Stack nutzen möchten, müssen Sie parallel ein separates Vision-Modell wie Qwen 3.5 9B einsetzen.
- Langer Kontext
- Scout zielt auf 10 Mio. Tokens ab (in der Praxis sind 256.000 stabil). Qwen3-30B-A3B bietet nativ 256.000 Tokens, ist berechenbarer und benötigt weniger KV-Cache.
#Fehlerbehebung
- "Error: model requires more system memory than is available"
- Ihr VRAM und RAM reichen zusammen nicht aus. Wechseln Sie entweder zu einer stärkeren Quantisierung (bei Q4 selten möglich, da bereits stark komprimiert) oder zu einem anderen Modell. Auch Ollama kann hier nicht zaubern.
- Geschwindigkeit < 5 Tokens/sec auf GPU mit 24 GB
- Bei Ihnen wird das Modell auf die CPU ausgelagert. Prüfen Sie dies mit ollama ps: Die Spalte PROCESSOR muss 100% GPU anzeigen. Ist das nicht der Fall, eignet sich Scout nicht für Ihren Rechner.
- Abgeschnittene Antworten
- Erhöhen Sie num_predict (in manchen Konfigurationen beträgt der Standardwert 128). Mit /set parameter num_predict 2048 in der Sitzung oder über ein Modelfile.
- Abstürze bei mehr als 64.000 Tokens
- Der KV-Cache lastet den VRAM vollständig aus. Verringern Sie num_ctx oder aktivieren Sie die KV-Cache-Quantisierung über die Umgebungsvariablen OLLAMA_FLASH_ATTENTION=1 + OLLAMA_KV_CACHE_TYPE=q8_0.
- Bild abgelehnt mit "unsupported image format"
- Konvertieren Sie das Bild in ein standardmäßiges JPEG- oder PNG-Format. Je nach Ollama-Version werden WebP, HEIC und AVIF nicht alle unterstützt.
#Weiterführende Informationen
Sobald Scout einsatzbereit ist, lohnt es sich, mehrere Ansätze zu erkunden, um seine Besonderheiten zu nutzen.
- Die richtige Quantisierung wählen
- Q4_K_M ist der Sweet Spot für Scout. Wann sich der Wechsel zu Q5 oder Q8 lohnt, hängt jedoch vom Anwendungsfall ab – besonders bei multimodalen Aufgaben, bei denen die Quantisierung die Qualität stärker beeinträchtigen kann als bei reinem Text.
- Lokale Bildverarbeitung nutzen
- Der spezielle Leitfaden zur Bildverarbeitung behandelt Promptmuster, die mit Scout und seinen multimodalen Konkurrenten wie Qwen 3.5 9B und Gemma 4 12B tatsächlich funktionieren (kontextbezogene OCR, strukturierte Extraktion, Bildvergleiche).
- Modelfile zum Anpassen
- Über num_ctx hinaus können Sie mit einem Modelfile einen Systemprompt, ein JSON-Ausgabeformat und eine für Ihren Anwendungsfall passende Temperatur festlegen – nützlich, damit Sie nicht bei jeder Sitzung alles neu konfigurieren müssen.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.