Mittelstufe 11 Min.Qwen

Qwen3.6 35B-A3B lokal: Test und Anforderungen VRAM

Qwen3.6 35B-A3B ist ein Mixture-of-Experts-Modell (MoE) von Alibaba: insgesamt 35 Milliarden Parameter, von denen aber nur 3 Milliarden pro Token aktiviert werden. Auf dem Papier verspricht das die Qualität eines 30B+-Modells bei der Geschwindigkeit eines 3B-Modells. In der Praxis liegt der Haken woanders: beim VRAM. Dieser Leitfaden misst für jede Quantisierung, was tatsächlich nötig ist, um qwen3.6 lokal zu betreiben, und wie viele Tokens pro Sekunde gängige Grafikkarten dabei erzeugen.

Von Mohamed Meguedmi·Aktualisierung 2026-06-03·Unter Windows, macOS und Linux getestet

#Warum Qwen3.6 35B-A3B lokal ausführen?

Drei konkrete Gründe sprechen dafür, dieses Modell statt eines klassischen dichten 32B-Modells auszuprobieren. Erstens die Geschwindigkeit: Nur die 3B aktiven Parameter sind an der Berechnung jedes Tokens beteiligt, sodass die Inferenz bei gleicher VRAM-Kapazität deutlich schneller läuft als mit einem dichten Qwen-32B-Modell. Zweitens die Qualität: Auf öffentlichen Benchmarks kann sich das 35B-A3B beim logischen Schlussfolgern, bei Code und bei Französisch gegenüber einem dichten 14B–24B-Modell behaupten.

Schließlich ist dies eines der wenigen Modelle, das dieses Gleichgewicht unter einer permissiven Lizenz bietet, die den Einsatz in der Produktion erlaubt. Wenn Sie einen präzisen Allround-Assistenten suchen, der schnell antwortet und auf eine Grafikkarte mit 24 GB passt, ist Qwen3.6 35B-A3B heute einer der besten Kandidaten.

i
Der entschlüsselte Name
35B = insgesamt 35 Milliarden Parameter. A3B = 3 Milliarden „aktive“ Parameter pro Token. Der MoE-Router wählt bei jedem Durchlauf dynamisch einige Experten aus insgesamt etwa 64 aus. Das reduziert den Rechenaufwand, aber nicht den Speicherbedarf.

#MoE-Architektur in einer Minute

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

In einem dichten Modell durchläuft jedes Token alle Schichten und alle Neuronen. In einem MoE werden bestimmte Feed-Forward-Schichten durch eine Gruppe unabhängiger Experten ersetzt, und ein kleines „Router“-Netzwerk entscheidet für jedes Token, welche Experten aktiviert werden (typischerweise 2 bis 8). Der Rest schläft.

Rechenaufwand pro Token
Proportional zur Anzahl der aktiven Parameter (3B). Deshalb ist die Generierung schnell.
Speicher (VRAM)
Proportional zum Gesamtumfang (35B). Alle Experten müssen geladen werden, man weiß nie im Voraus, welcher aufgerufen wird.
Qualität
Zwischen einem dichten 3B-Modell und einem dichten 35B-Modell. Bei allgemeinen Aufgaben kommt es in der Praxis einem dichten Modell mit 14B–24B nahe.
Batchempfindlichkeit
Bei jeweils nur einem Prompt zeigt das MoE seine Stärke. Bei sehr großen Batches schwindet der Rechenvorteil, da letztlich alle Experten aktiviert werden.
→
Warum das für Self-Hosting interessant ist
Auf einer RTX 4090 mit 24 GB VRAM kommt ein dichtes Qwen-32B-Modell in Q4 oft nicht über 25–35 Tokens/s hinaus. Qwen3.6 35B-A3B läuft bei derselben VRAM-Kapazität mit etwa 70–90 Tokens/s und liefert bei den meisten nicht spezialisierten Aufgaben eine vergleichbare Antwortqualität.

#Hardware-Voraussetzungen

Mindestbedarf an VRAM
16 GB zum Testen (Q3, teilweiser CPU-Offload akzeptabel). 20–24 GB für einen reibungslosen Betrieb in Q4.
Großzügig bemessener VRAM
32 GB (RTX 5090) oder 48 GB (Apples gemeinsamer Speicher) für Q5/Q6 und ein großes Kontextfenster.
System-RAM
Mindestens 32 GB, wenn Sie CPU-Offload in Kauf nehmen. 64 GB, wenn Sie das Modell ausschließlich in den Arbeitsspeicher laden.
Festplatte
22 GB für Q4_K_M, 70 GB für FP16 einplanen. Eine NVMe-SSD wird dringend empfohlen.
OS / Laufzeitumgebung
Linux, macOS (Apple Silicon), Windows 11. Ollama ≥ 0.5.x oder eine aktuelle Version von llama.cpp (Build nach März 2026).
!
MoE ≠ kleines Modell
Lassen Sie sich nicht von „3B aktiv“ täuschen: Das gesamte Modell muss trotzdem in den VRAM geladen werden. Eine RTX 4060 mit 8 GB reicht nicht aus, auch wenn die Inferenz „nur 3B berechnet“. Alle Experten müssen jederzeit sofort verfügbar sein.

#Tatsächlicher VRAM-Bedarf je Quantisierung

Hier sind die mit llama.cpp bei einem Kontext von 8 k Tokens gemessenen Speicherbedarfe (Modell + KV-Cache + Overhead). Die Werte umfassen auch den Speicherbedarf der Laufzeitumgebung, nicht nur die Größe der GGUF-Datei auf der Festplatte.

Q2_K (≈ 13 GB)
Auf RTX 4070 / 4060 Ti 16 GB möglich. Deutlicher Qualitätsverlust, vor allem bei Code und mehrstufigem Schlussfolgern. Nur als Notlösung vorsehen.
Q3_K_M (≈ 17 GB)
Passt mit einem kleinen Kontext auf eine RX 7900 GRE / 4080 / 5070 Ti mit 16 GB. Die Qualität ist für allgemeine Chats auf Französisch noch angemessen.
Q4_K_M (≈ 22 GB)
Der Sweet Spot. Läuft problemlos auf RTX 3090 / 4090 / 7900 XTX (24 GB) und RTX 5090 (32 GB). Als Standard empfohlen.
Q5_K_M (≈ 26 GB)
Benötigt 32 GB (RTX 5090) oder einen Mac der M-Serie mit mindestens 36 GB. Geringer Qualitätsgewinn gegenüber Q4, außer bei Code.
Q6_K (≈ 30 GB)
Nur für RTX 5090, Mac Studio oder Multi-GPU-Konfigurationen. Bei den Ausgaben für Nutzer gibt es kaum Unterschiede zu Q8.
Q8_0 (≈ 37 GB)
Mac Studio M2/M3/M5 Ultra oder ein System mit zwei GPUs (2× 3090). Qualität nahezu auf FP16-Niveau.
FP16 (≈ 70 GB)
Forschung, Fine-Tuning, vLLM im Produktionsbetrieb. Für die meisten lokalen Setups nicht praktikabel.
→
Welche Quantisierung wählen?
Für 95 % der Anwendungsfälle ist Q4_K_M die richtige Standardeinstellung: Sie erhält den Großteil der Qualität, spart VRAM und erhöht den Durchsatz. Wechseln Sie nur zu Q5/Q6, wenn Sie bei Ihren Prompts tatsächlich Qualitätsverschlechterungen festgestellt haben.

#Installation mit Ollama

Ollama bleibt der kürzeste Weg. Falls Sie es noch nicht haben, installieren Sie es (siehe die entsprechende Installationsanleitung für Ihr Betriebssystem). Sobald der Daemon auf Port 11434 läuft, genügt ein einziger Befehl.

Herunterladen und starten
ollama run qwen3.6:35b-a3b-q4_K_M

Der Download umfasst etwa 21 GB. Beim ersten Prompt wird das Modell in den VRAM geladen; nachfolgende Starts erfolgen nahezu sofort, solange das Modell aktiv im Speicher bleibt.

GPU-Zuweisung prüfen
ollama ps

Die Spalte PROCESSOR muss 100 % GPU anzeigen. Wenn Sie eine Mischung aus CPU und GPU sehen, reicht der VRAM nicht aus: Wechseln Sie zu einer aggressiveren Quantisierung (Q3_K_M), reduzieren Sie num_ctx oder nehmen Sie den geringeren Durchsatz in Kauf.

i
Kontext erweitern
Standardmäßig begrenzt Ollama den Kontext auf 2048 Tokens. Für die Zusammenfassung von Dokumenten oder längere Gespräche erstellen Sie ein Modelfile, das num_ctx auf 8192 oder 16384 festlegt – jede Verdoppelung benötigt einige Hundert MB zusätzlichen VRAM.
Minimales Modelfile
# fichier : Modelfile.qwen36-long
FROM qwen3.6:35b-a3b-q4_K_M
PARAMETER num_ctx 16384
PARAMETER temperature 0.7

# build
# ollama create qwen36-long -f Modelfile.qwen36-long

#Installation mit llama.cpp

Wer die Platzierung der Experten, den Batch oder den KV-Cache präzise steuern möchte, hat mit llama.cpp mehr Spielraum. Man lädt eine GGUF-Datei in Q4_K_M von Hugging Face herunter (Modelle, die vom Qwen-Team oder von bartowski/unsloth veröffentlicht wurden) und startet anschließend den OpenAI-kompatiblen Server.

llama.cpp-Server
./llama-server \
  -m ./models/Qwen3.6-35B-A3B-Q4_K_M.gguf \
  --host 0.0.0.0 --port 8080 \
  -c 16384 \
  -ngl 99 \
  --flash-attn \
  --threads 8
-ngl 99
Lagert alle Schichten auf die GPU aus. Für reine CPU-Ausführung 0 setzen oder für eine Aufteilung einen Wert für einen Teil der Schichten verwenden.
-c 16384
Kontextgröße. Rechnen Sie pro zusätzlichen 4 k über dem Standardwert mit etwa 0,5 GB zusätzlichem KV-Cache.
--flash-attn
Aktiviert Flash Attention, wenn Ihr Build es unterstützt (CUDA, Metal). Deutliche Speichereinsparung bei langen Kontexten.
--threads 8
Hilft vor allem, wenn ein Teil der Berechnung auf der CPU läuft. Bei reinem GPU-Betrieb kaum Auswirkungen.
→
MoE und Expert-Offloading
Neuere Builds von llama.cpp unterstützen --override-tensor, um einige Experten im Arbeitsspeicher abzulegen. Auf einer 4070 mit 12 GB lässt sich dadurch Q4_K_M unterbringen, allerdings auf Kosten eines Teils des Durchsatzes. Suchen Sie nach der Dokumentation zu „expert offload“, wenn Sie sich näher damit beschäftigen möchten.

#Gemessene Inferenzgeschwindigkeit

Messungen mit Q4_K_M, Kontext 4096, kurzem Prompt (~200 Tokens), Generierung von 512 Tokens, Batch 1. Die Zahlen umfassen die Prompt-Evaluationsphase und die Generierung.

RTX 5090 32 GB
≈ 110–125 Tok/s bei der Generierung. Die Prompt-Eval-Phase überschreitet 4000 Tok/s. Komfortabel bis zu 32 k Kontext.
RTX 4090 24 GB
≈ 80–95 tok/s. Das Q4-Modell passt mit 16 k Kontext in den VRAM, ohne dessen Kapazität zu überschreiten.
RTX 3090 24 GB
≈ 55–70 tok/s. Gebraucht ein ausgezeichnetes Preis-Leistungs-Verhältnis, aber eine geringere Speicherbandbreite als bei der 4090.
Mac Studio M5 Max 64 GB
≈ 60–75 tok/s im Q4_K_M, ≈ 45–55 tok/s im Q8_0. Ideal für einen 24/7-stillen Server.
Radeon RX 7900 XTX 24 GB (ROCm)
≈ 45–60 tok/s. Ollama wird unterstützt, llama.cpp läuft mit ROCm/Vulkan.
RTX 4070 Ti Super 16 GB (Q3_K_M)
≈ 50–65 tok/s, Kontext auf 4 k begrenzt. Auf diesem Niveau ist ein dichtes Qwen-14B-Modell oft weiterhin die sinnvollere Wahl.
i
MoE und langer Kontext
Der Durchsatz bleibt bei der Generierung hoch, aber die Dauer der Prompt-Eval-Phase nimmt schnell zu, wenn 16 k Kontext eingebracht werden. Das ist normal: Alle Experten kommen irgendwann während der Verarbeitung des Prompts zum Einsatz. Für RAG bündeln Sie Ihre Anfragen in Batches.

#Nützliche Optimierungen

  1. 01
    Flash Attention aktivieren
    Bei Ollama geschieht das auf neueren GPUs automatisch. Bei llama.cpp --flash-attn hinzufügen. Deutliche VRAM-Einsparung bereits ab 8 k Kontext.
  2. 02
    KV-Cache quantisieren
    llama.cpp unterstützt --cache-type-k q8_0 --cache-type-v q8_0. Das spart beim Cache etwa 30 % VRAM bei nahezu keinem Qualitätsverlust.
  3. 03
    Die Anzahl der aktiven Experten verringern
    Einige Varianten unterstützen --override-kv qwen3moe.expert_used_count=2 (statt der standardmäßigen 4 oder 8). Schneller, mit leichtem Qualitätsverlust.
  4. 04
    num_ctx auf den benötigten Wert begrenzen
    16 k reichen für die meisten Chats völlig aus. 32 k+ sind nur für die Zusammenfassung langer Dokumente gerechtfertigt.
  5. 05
    Für interaktiven Chat batch=1 bevorzugen
    MoE verliert bei großen Batches an Vorteil: Wenn Sie mehrere Benutzer gleichzeitig bedienen, ziehen Sie vLLM statt Ollama in Betracht.

#Fehlerbehebung

OOM beim Laden auf RTX 4090
Reduzieren Sie num_ctx auf 4096 und prüfen Sie, dass kein anderer GPU-Prozess läuft (Browser, Spiel). Q4_K_M sollte hineinpassen und dabei 2 bis 3 GB frei lassen.
Generierung mit 5 Token pro Sekunde auf RTX 4090
Das Modell wird teilweise auf die CPU ausgelagert. ollama ps wird eine Mischung aus CPU- und GPU-Nutzung anzeigen. Schließen Sie alles, starten Sie Ollama neu oder wechseln Sie zu Q3_K_M.
Unkonsistente Antworten auf Französisch
Prüfen Sie, ob Sie die Instruct-Variante und nicht die Base-Variante verwenden. Das MoE-Routing reagiert empfindlich auf die Formulierung des Systemprompts – formulieren Sie direkt.
Erster Token sehr langsam (>10s)
Lange Prompt-Evaluierungsphase: Das ist bei einem großen Kontext mit MoE zu erwarten. Verwenden Sie den Prompt-Cache zwischen Anfragen wieder (Option --prompt-cache von llama.cpp).
Modell auf Ollama nicht auffindbar
Der genaue Tag kann abweichen (qwen3.6 vs qwen3_6 vs qwen36). Suchen Sie auf ollama.com/library, bevor Sie den Befehl eingeben.

#Weiterführende Informationen

Jetzt, da Qwen3.6 35B-A3B bei Ihnen läuft, finden Sie hier einige Anregungen, um Ihr Setup weiter auszubauen:

Quantisierung wählen (Q4, Q5, Q8, FP16)
Um genau zu verstehen, was bei einem MoE-Modell zwischen Q3, Q4 und Q5 passiert.
Open WebUI mit Ollama
Eine ChatGPT-ähnliche Oberfläche mit Gesprächsverlauf und RAG für Ihr lokales Qwen3.6.
GPU für lokale KI auswählen
Wenn Sie bei einem solchen MoE-Modell mit 30B oder mehr zwischen einer gebrauchten 3090, einer 4090 und einer 5090 schwanken.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.