Mittelstufe 12 Min.Ollama

Llama 4 Scout lokal: Installation und erste Tests mit Ollama

Llama 4 Scout ist das kleinste der drei Modelle aus Metas Llama-4-Familie. Es ist auch das einzige, das lokal auf einer High-End-Workstation Platz findet — Maverick und Behemoth bleiben der Cloud oder dedizierten Servern vorbehalten. Dieser Leitfaden zeigt, wie Sie Llama 4 Scout mit Ollama installieren, wie viel VRAM Sie tatsächlich benötigen (das MoE-Versprechen wird oft missverstanden) und wie Sie seine beiden besonderen Stärken nutzen: native Multimodalität und ein Kontextfenster von 10 Millionen Tokens.

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum Llama 4 Scout lokal mit Ollama installieren?

Scout ist das einzige Modell der Llama-4-Reihe, das für den Betrieb auf einem einzigen Rechner konzipiert wurde. Meta hat es als „Workstation-Modell“ der Familie positioniert: von Haus aus multimodal (Text + Bilder), mit einem angekündigten Kontextfenster von 10 Millionen Tokens und einer MoE-Architektur (Mixture of Experts), die bei jedem Token nur einen Bruchteil der Parameter aktiviert.

Im Vergleich zu einem dichten Modell gleicher Größe bietet Scout konkret eine geringere Latenz (wenige aktive Parameter pro Token), einen deutlich größeren Kontextspeicher und integrierte Bildverarbeitung ohne separates Modell. Der Preis dafür: ein erheblicher Speicherbedarf auf dem Datenträger (alle Experten müssen im VRAM geladen bleiben, damit das Routing funktioniert).

i
MoE kurz erklärt
Ein MoE-Modell wie Scout enthält N „Experten“ (spezialisierte Teilnetzwerke). Für jedes Token wählt ein Router k davon aus (typischerweise 1 oder 2). Nur diese k Experten führen Berechnungen aus. Das Ergebnis: Die Inferenzgeschwindigkeit entspricht der eines kleinen Modells, während die Qualität tendenziell der eines großen Modells nahekommt. Sämtliche Parameter bleiben im VRAM – nur die Berechnungen betreffen einen Teil des Modells.

#Scout, Maverick, Behemoth: Wer macht was?

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen
Scout (17B aktive Parameter)
Das Workstation-Modell. 16 Experten, insgesamt ~109 Milliarden Parameter. Multimodal. Kontext: 10 Millionen Tokens. Zielhardware: RTX 4090, M3/M4 Max/Ultra oder ein Multi-GPU-Setup mit mindestens 48 GB.
Maverick (17B aktive Parameter)
Das Servermodell. 128 Experten, insgesamt ~400 Milliarden Parameter. Genauso viele aktive Parameter wie Scout, aber deutlich mehr gespeichertes Wissen. Ziel: Server mit 8x H100 oder ein Cluster. Für die meisten Konfigurationen kommt ein lokaler Betrieb nicht infrage.
Behemoth (288 Milliarden aktive Parameter)
Das Frontier-Modell. Insgesamt etwa 2 Billionen Parameter. Ohne Rechenzentrum nicht lokal ausführbar. Vor allem als „Lehrermodell“ nützlich, um die beiden anderen zu distillieren.
→
Welches wählen?
Wenn Sie diesen Leitfaden lesen und lokal installieren möchten, ist Scout die richtige Wahl. Maverick erfordert mindestens einen leistungsstarken Multi-GPU-Server — auf diesem Niveau sind die Leitfäden zu DeepSeek V4 Flash oder Qwen3.7 Max besser geeignet.

#Tatsächlicher VRAM-Bedarf: Was das Datenblatt nicht verrät

Der klassische Fehler bei MoE-Modellen besteht darin, nur die aktiven Parameter als Berechnungsgrundlage zu nehmen. „17B aktive Parameter = das passt in Q4 in 12 GB“: falsch. Damit das Routing funktioniert, müssen alle Experten im Speicher bleiben. Scout in Q4_K_M benötigt deutlich mehr Speicher, als seine 17B aktiven Parameter vermuten lassen.

Q4_K_M (empfohlen)
≈ 65 GB VRAM allein für das Modell. Für einen angemessenen Kontext (32k Tokens) zusätzlich ~4 GB einplanen. Insgesamt ≈ 70 GB.
Q5_K_M
≈ 78 GB. Geringer Qualitätsgewinn gegenüber dem Q4_K_M bei der Mehrzahl der Aufgaben.
Q8_0
≈ 115 GB. Referenzbenchmarks vorbehalten.
FP16
≈ 220 GB. Nur in der Cloud oder auf mehreren Servern.
!
Nicht für eine GPU mit 24 GB geeignet
Wenn Sie eine RTX 4090 oder nur eine einzelne 3090 haben, läuft Scout nicht richtig. Sie können CPU-Offloading erzwingen, aber die Geschwindigkeit bricht ein (< 2 Tokens/s). Für eine GPU mit 24 GB sollten Sie sich eher Qwen3-30B-A3B oder Mistral Small 24B ansehen. Für eine RTX 5090 mit 32 GB bleibt Qwen 3.6 35B-A3B sinnvoller als Scout mit Offloading.

Konfigurationen, auf denen Scout lokal komfortabel läuft:

Mac Studio M3 Ultra / M5 Ultra mit 96 GB und mehr
Die beste Plattform für Privatnutzer, um Scout auszuführen. Unified Memory, kein Offloading, ~25–40 Tokens/s je nach Quantisierung.
2x RTX 4090 / 2x 5090
48 GB oder 64 GB zusammen, ausreichend für Q4_K_M mit erweitertem Kontext. Auf llama.cpp oder Ollama mit der Variablen OLLAMA_NUM_GPU setzen
Workstation mit RTX 6000 Ada (48 GB) oder A6000
Bietet problemlos Platz für Scout Q4 und lässt noch Spielraum für den Kontext.

#Voraussetzungen

Ollama 0.6 oder neuer
Die Unterstützung für Llama 4 wurde mit Ollama 0.6 eingeführt. Prüfen Sie Ihre Version mit ollama --version und aktualisieren Sie Ollama, falls sie älter ist.
70 GB freier Festplattenspeicher
Das Modell mit dem Tag Q4_K_M ist etwa 65 GB groß. Planen Sie großzügig zusätzlichen Platz für den Cache ein.
Hohe Speicherbandbreite
Auf dem Mac: ≥ 400 GB/s anstreben (M3 Max und höher). Auf dem PC: DDR5, wenn CPU-Offload vorgesehen ist.
Eine stabile Verbindung
Der erste Download kann 1 bis 3 Stunden dauern, je nach Ihrem Link. ollama pull supporte Die Wiederherstellung im Falle einer Unterbrechung.

#1. Llama 4 Scout mit Ollama installieren

Wenn Ollama noch nicht installiert ist, folgen Sie zunächst der passenden Anleitung für Ihr System. Anschließend lässt sich Scout mit einem einzigen Befehl herunterladen.

Terminal – Modell herunterladen
ollama pull llama4:scout

Dieser Tag verweist standardmäßig auf die Quantisierung Q4_K_M. Wenn Sie eine andere Variante erzwingen möchten:

Verfügbare Varianten
ollama pull llama4:scout-q5_K_M
ollama pull llama4:scout-q8_0
ollama pull llama4:scout-fp16

Listen Sie nach Abschluss des Downloads die Modelle auf, um die tatsächliche Größe zu überprüfen:

Prüfung
ollama list
i
Geduld beim ersten Laden
65 GB in den VRAM zu laden, dauert eine Weile: je nach SSD zwischen 30 Sekunden und 2 Minuten. Nachfolgende Ladevorgänge sind dank des Betriebssystem-Caches schneller.

#2. Erster Test: Text und logisches Denken

Starten Sie eine interaktive Sitzung, um die ordnungsgemäße Funktion zu überprüfen, bevor Sie den Rest bearbeiten.

Interaktive Sitzung
ollama run llama4:scout

Sobald der Prompt >>> erscheint, überprüfen Sie die Sprache und die Qualität der Schlussfolgerungen mit einem einfachen Test:

Test-Prompt
>>> Explique en 4 phrases ce qu'est un modèle MoE, puis donne un avantage et un inconvénient.

[Réponse attendue : explication structurée en français, distinction entre paramètres totaux et actifs, mention de la latence comme avantage et de la VRAM comme inconvénient.]

Öffnen Sie während des laufenden Gesprächs ein zweites Terminal, um die Auslastung zu beobachten:

Die Auslastung überwachen
ollama ps

Die Spalte SIZE muss die tatsächlich geladene Modellgröße widerspiegeln. Unter PROCESSOR sollte idealerweise 100 % GPU stehen. Wenn Sie eine Mischung aus CPU und GPU sehen, reicht der VRAM nicht aus und Ollama lagert Teile des Modells aus – darunter leidet die Geschwindigkeit erheblich.

#3. Test der Bildverarbeitung auf Französisch

Scout ist von Grund auf multimodal: Bild und Text werden durch dasselbe Backbone verarbeitet, anders als bei einem Ansatz, der einen separaten visuellen Encoder an ein rein textbasiertes Modell anhängt. Das führt zu besseren Ergebnissen bei Aufgaben, die beide Modalitäten kombinieren (kontextbezogene OCR, Lesen von Diagrammen, detaillierte Beschreibungen).

Mit der REST-API von Ollama sendet man das Bild im Base64-Format in das Feld 'images':

Python-Test für Vision
import base64, requests, json

with open('facture.jpg', 'rb') as f:
    img_b64 = base64.b64encode(f.read()).decode()

response = requests.post(
    'http://localhost:11434/api/generate',
    json={
        'model': 'llama4:scout',
        'prompt': 'Décris cette image en français. Si c\'est un document, extrais les montants et la date.',
        'images': [img_b64],
        'stream': False,
    }
)
print(response.json()['response'])

Bei typischen Fällen (Screenshot einer Benutzeroberfläche, Foto eines Whiteboards, PDF-Scan) liefert Scout eine detaillierte Beschreibung und bleibt auf Französisch konsistent, auch wenn das Bild englischen Text enthält. Bei strukturierten Details liegt es eine Stufe über einem kleinen, allgemein einsetzbaren Bildverarbeitungsmodell wie Qwen 3.5 9B.

→
Bildformat
JPEG und PNG funktionieren. Vermeiden Sie zu große Bilder (> 4 MB): Ollama passt ihre Größe an, aber das ist aufwendig. Verkleinern Sie die Bilder vor dem Senden so, dass die längste Seite höchstens 1024 px misst.

#4. Kontext mit 10M Tokens: Versprechen und Realität

Meta gibt für Scout ein Kontextfenster von 10 Millionen Tokens an. In der Praxis gibt es beim lokalen Betrieb zwei Grenzen.

Der KV-Cache explodiert
Bei 1 Million Tokens erhöht der KV-Cache den vom Modell belegten VRAM leicht um 30 bis 50 GB. Darüber hinaus muss die Quantisierung des KV-Caches aktiviert werden (Option num_ctx plus experimentelle Parameter), oder man muss sich mit einem CPU-Offload des Caches abfinden.
Die Qualität sinkt bereits weit vor 10M
Unabhängige Benchmarks (RULER, NoLiMa) zeigen trotz des Trainings mit langen Kontexten einen Einbruch der praktisch nutzbaren Leistung bei etwa 256k–512k Tokens. Darüber hinaus ist es technisch möglich, aber wenig zuverlässig.

Um einen erweiterten Kontext zu nutzen, ohne dass alles abstürzt, konfigurieren Sie Ollama über ein Modelfile:

Modelfile für Kontext 128k
FROM llama4:scout

PARAMETER num_ctx 131072
PARAMETER num_predict 4096
PARAMETER temperature 0.6
Erstellung der Variante
ollama create llama4-scout-128k -f Modelfile
ollama run llama4-scout-128k
!
128k ist bereits viel
Ein Kontext von 128k Tokens entspricht bereits etwa 250 Seiten Text. Für 95 % der lokalen Anwendungsfälle (gesamte Codebasis, lange PDF-Dateien, Ticketarchive) ist das mehr als ausreichend und deutlich stabiler als Konfigurationen mit 1M Tokens oder mehr.

#Scout vs Qwen3-30B-A3B: der echte Vergleich

Qwen3-30B-A3B ist das andere MoE-Modell, das 2026 ernsthaft für den lokalen Einsatz in Betracht kommt: 30 Milliarden Parameter insgesamt, 3 Milliarden aktive Parameter, ein nativer Kontext von 256k Tokens. Der Vergleich lohnt sich, denn die beiden Modelle spielen hinsichtlich ihrer Hardwareanforderungen nicht in derselben Liga.

VRAM-Bedarf bei Q4
Scout ≈ 65 GB. Qwen3-30B-A3B ≈ 18 GB. Der Unterschied ist enorm und verändert die Anforderungen an den Zielrechner grundlegend.
Generationsgeschwindigkeit
Bei vergleichbarer Anzahl aktiver Parameter (17B vs. 3B) ist Qwen3-30B-A3B in Tokens/s schneller – typischerweise 2–3-mal so schnell auf derselben Maschine, wenn beide Modelle in den Speicher passen.
Qualität des Schlussfolgerns
In den öffentlichen Benchmarks MMLU-Pro und GPQA liegt Scout weiterhin vor Qwen3-30B-A3B. Der Abstand verringert sich erheblich, wenn der Thinking-Modus von Qwen3 aktiviert ist.
Multimodalität
Scout ist von Haus aus multimodal. Qwen3-30B-A3B ist es nicht – wenn Sie Bildverarbeitung im selben Stack nutzen möchten, müssen Sie parallel ein separates Vision-Modell wie Qwen 3.5 9B einsetzen.
Langer Kontext
Scout zielt auf 10 Mio. Tokens ab (in der Praxis sind 256.000 stabil). Qwen3-30B-A3B bietet nativ 256.000 Tokens, ist berechenbarer und benötigt weniger KV-Cache.
→
Praktisches Fazit
Wenn Sie ein Mac Studio Ultra, eine 2x RTX 4090 oder eine A6000 besitzen, wählen Sie Scout für native Vision und Qualität. Wenn Sie nur eine RTX 4090, eine 3090 oder einen Mac M3 Max mit 36-64 GB nutzen, wählen Sie Qwen3-30B-A3B – das ist rational und deutlich schneller. Der CPU-Offload von Scout auf dieser Art von Maschine ist eine falsche gute Idee.

#Fehlerbehebung

"Error: model requires more system memory than is available"
Ihr VRAM und RAM reichen zusammen nicht aus. Wechseln Sie entweder zu einer stärkeren Quantisierung (bei Q4 selten möglich, da bereits stark komprimiert) oder zu einem anderen Modell. Auch Ollama kann hier nicht zaubern.
Geschwindigkeit < 5 Tokens/sec auf GPU mit 24 GB
Bei Ihnen wird das Modell auf die CPU ausgelagert. Prüfen Sie dies mit ollama ps: Die Spalte PROCESSOR muss 100% GPU anzeigen. Ist das nicht der Fall, eignet sich Scout nicht für Ihren Rechner.
Abgeschnittene Antworten
Erhöhen Sie num_predict (in manchen Konfigurationen beträgt der Standardwert 128). Mit /set parameter num_predict 2048 in der Sitzung oder über ein Modelfile.
Abstürze bei mehr als 64.000 Tokens
Der KV-Cache lastet den VRAM vollständig aus. Verringern Sie num_ctx oder aktivieren Sie die KV-Cache-Quantisierung über die Umgebungsvariablen OLLAMA_FLASH_ATTENTION=1 + OLLAMA_KV_CACHE_TYPE=q8_0.
Bild abgelehnt mit "unsupported image format"
Konvertieren Sie das Bild in ein standardmäßiges JPEG- oder PNG-Format. Je nach Ollama-Version werden WebP, HEIC und AVIF nicht alle unterstützt.

#Weiterführende Informationen

Sobald Scout einsatzbereit ist, lohnt es sich, mehrere Ansätze zu erkunden, um seine Besonderheiten zu nutzen.

Die richtige Quantisierung wählen
Q4_K_M ist der Sweet Spot für Scout. Wann sich der Wechsel zu Q5 oder Q8 lohnt, hängt jedoch vom Anwendungsfall ab – besonders bei multimodalen Aufgaben, bei denen die Quantisierung die Qualität stärker beeinträchtigen kann als bei reinem Text.
Lokale Bildverarbeitung nutzen
Der spezielle Leitfaden zur Bildverarbeitung behandelt Promptmuster, die mit Scout und seinen multimodalen Konkurrenten wie Qwen 3.5 9B und Gemma 4 12B tatsächlich funktionieren (kontextbezogene OCR, strukturierte Extraktion, Bildvergleiche).
Modelfile zum Anpassen
Über num_ctx hinaus können Sie mit einem Modelfile einen Systemprompt, ein JSON-Ausgabeformat und eine für Ihren Anwendungsfall passende Temperatur festlegen – nützlich, damit Sie nicht bei jeder Sitzung alles neu konfigurieren müssen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.