Qwen3.6 35B-A3B lokal: Test und Anforderungen VRAM
Qwen3.6 35B-A3B ist ein Mixture-of-Experts-Modell (MoE) von Alibaba: insgesamt 35 Milliarden Parameter, von denen aber nur 3 Milliarden pro Token aktiviert werden. Auf dem Papier verspricht das die Qualität eines 30B+-Modells bei der Geschwindigkeit eines 3B-Modells. In der Praxis liegt der Haken woanders: beim VRAM. Dieser Leitfaden misst für jede Quantisierung, was tatsächlich nötig ist, um qwen3.6 lokal zu betreiben, und wie viele Tokens pro Sekunde gängige Grafikkarten dabei erzeugen.
#Warum Qwen3.6 35B-A3B lokal ausführen?
Drei konkrete Gründe sprechen dafür, dieses Modell statt eines klassischen dichten 32B-Modells auszuprobieren. Erstens die Geschwindigkeit: Nur die 3B aktiven Parameter sind an der Berechnung jedes Tokens beteiligt, sodass die Inferenz bei gleicher VRAM-Kapazität deutlich schneller läuft als mit einem dichten Qwen-32B-Modell. Zweitens die Qualität: Auf öffentlichen Benchmarks kann sich das 35B-A3B beim logischen Schlussfolgern, bei Code und bei Französisch gegenüber einem dichten 14B–24B-Modell behaupten.
Schließlich ist dies eines der wenigen Modelle, das dieses Gleichgewicht unter einer permissiven Lizenz bietet, die den Einsatz in der Produktion erlaubt. Wenn Sie einen präzisen Allround-Assistenten suchen, der schnell antwortet und auf eine Grafikkarte mit 24 GB passt, ist Qwen3.6 35B-A3B heute einer der besten Kandidaten.
#MoE-Architektur in einer Minute
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
In einem dichten Modell durchläuft jedes Token alle Schichten und alle Neuronen. In einem MoE werden bestimmte Feed-Forward-Schichten durch eine Gruppe unabhängiger Experten ersetzt, und ein kleines „Router“-Netzwerk entscheidet für jedes Token, welche Experten aktiviert werden (typischerweise 2 bis 8). Der Rest schläft.
- Rechenaufwand pro Token
- Proportional zur Anzahl der aktiven Parameter (3B). Deshalb ist die Generierung schnell.
- Speicher (VRAM)
- Proportional zum Gesamtumfang (35B). Alle Experten müssen geladen werden, man weiß nie im Voraus, welcher aufgerufen wird.
- Qualität
- Zwischen einem dichten 3B-Modell und einem dichten 35B-Modell. Bei allgemeinen Aufgaben kommt es in der Praxis einem dichten Modell mit 14B–24B nahe.
- Batchempfindlichkeit
- Bei jeweils nur einem Prompt zeigt das MoE seine Stärke. Bei sehr großen Batches schwindet der Rechenvorteil, da letztlich alle Experten aktiviert werden.
#Hardware-Voraussetzungen
- Mindestbedarf an VRAM
- 16 GB zum Testen (Q3, teilweiser CPU-Offload akzeptabel). 20–24 GB für einen reibungslosen Betrieb in Q4.
- Großzügig bemessener VRAM
- 32 GB (RTX 5090) oder 48 GB (Apples gemeinsamer Speicher) für Q5/Q6 und ein großes Kontextfenster.
- System-RAM
- Mindestens 32 GB, wenn Sie CPU-Offload in Kauf nehmen. 64 GB, wenn Sie das Modell ausschließlich in den Arbeitsspeicher laden.
- Festplatte
- 22 GB für Q4_K_M, 70 GB für FP16 einplanen. Eine NVMe-SSD wird dringend empfohlen.
- OS / Laufzeitumgebung
- Linux, macOS (Apple Silicon), Windows 11. Ollama ≥ 0.5.x oder eine aktuelle Version von llama.cpp (Build nach März 2026).
#Tatsächlicher VRAM-Bedarf je Quantisierung
Hier sind die mit llama.cpp bei einem Kontext von 8 k Tokens gemessenen Speicherbedarfe (Modell + KV-Cache + Overhead). Die Werte umfassen auch den Speicherbedarf der Laufzeitumgebung, nicht nur die Größe der GGUF-Datei auf der Festplatte.
- Q2_K (≈ 13 GB)
- Auf RTX 4070 / 4060 Ti 16 GB möglich. Deutlicher Qualitätsverlust, vor allem bei Code und mehrstufigem Schlussfolgern. Nur als Notlösung vorsehen.
- Q3_K_M (≈ 17 GB)
- Passt mit einem kleinen Kontext auf eine RX 7900 GRE / 4080 / 5070 Ti mit 16 GB. Die Qualität ist für allgemeine Chats auf Französisch noch angemessen.
- Q4_K_M (≈ 22 GB)
- Der Sweet Spot. Läuft problemlos auf RTX 3090 / 4090 / 7900 XTX (24 GB) und RTX 5090 (32 GB). Als Standard empfohlen.
- Q5_K_M (≈ 26 GB)
- Benötigt 32 GB (RTX 5090) oder einen Mac der M-Serie mit mindestens 36 GB. Geringer Qualitätsgewinn gegenüber Q4, außer bei Code.
- Q6_K (≈ 30 GB)
- Nur für RTX 5090, Mac Studio oder Multi-GPU-Konfigurationen. Bei den Ausgaben für Nutzer gibt es kaum Unterschiede zu Q8.
- Q8_0 (≈ 37 GB)
- Mac Studio M2/M3/M5 Ultra oder ein System mit zwei GPUs (2× 3090). Qualität nahezu auf FP16-Niveau.
- FP16 (≈ 70 GB)
- Forschung, Fine-Tuning, vLLM im Produktionsbetrieb. Für die meisten lokalen Setups nicht praktikabel.
#Installation mit Ollama
Ollama bleibt der kürzeste Weg. Falls Sie es noch nicht haben, installieren Sie es (siehe die entsprechende Installationsanleitung für Ihr Betriebssystem). Sobald der Daemon auf Port 11434 läuft, genügt ein einziger Befehl.
Der Download umfasst etwa 21 GB. Beim ersten Prompt wird das Modell in den VRAM geladen; nachfolgende Starts erfolgen nahezu sofort, solange das Modell aktiv im Speicher bleibt.
Die Spalte PROCESSOR muss 100 % GPU anzeigen. Wenn Sie eine Mischung aus CPU und GPU sehen, reicht der VRAM nicht aus: Wechseln Sie zu einer aggressiveren Quantisierung (Q3_K_M), reduzieren Sie num_ctx oder nehmen Sie den geringeren Durchsatz in Kauf.
#Installation mit llama.cpp
Wer die Platzierung der Experten, den Batch oder den KV-Cache präzise steuern möchte, hat mit llama.cpp mehr Spielraum. Man lädt eine GGUF-Datei in Q4_K_M von Hugging Face herunter (Modelle, die vom Qwen-Team oder von bartowski/unsloth veröffentlicht wurden) und startet anschließend den OpenAI-kompatiblen Server.
- -ngl 99
- Lagert alle Schichten auf die GPU aus. Für reine CPU-Ausführung 0 setzen oder für eine Aufteilung einen Wert für einen Teil der Schichten verwenden.
- -c 16384
- Kontextgröße. Rechnen Sie pro zusätzlichen 4 k über dem Standardwert mit etwa 0,5 GB zusätzlichem KV-Cache.
- --flash-attn
- Aktiviert Flash Attention, wenn Ihr Build es unterstützt (CUDA, Metal). Deutliche Speichereinsparung bei langen Kontexten.
- --threads 8
- Hilft vor allem, wenn ein Teil der Berechnung auf der CPU läuft. Bei reinem GPU-Betrieb kaum Auswirkungen.
#Gemessene Inferenzgeschwindigkeit
Messungen mit Q4_K_M, Kontext 4096, kurzem Prompt (~200 Tokens), Generierung von 512 Tokens, Batch 1. Die Zahlen umfassen die Prompt-Evaluationsphase und die Generierung.
- RTX 5090 32 GB
- ≈ 110–125 Tok/s bei der Generierung. Die Prompt-Eval-Phase überschreitet 4000 Tok/s. Komfortabel bis zu 32 k Kontext.
- RTX 4090 24 GB
- ≈ 80–95 tok/s. Das Q4-Modell passt mit 16 k Kontext in den VRAM, ohne dessen Kapazität zu überschreiten.
- RTX 3090 24 GB
- ≈ 55–70 tok/s. Gebraucht ein ausgezeichnetes Preis-Leistungs-Verhältnis, aber eine geringere Speicherbandbreite als bei der 4090.
- Mac Studio M5 Max 64 GB
- ≈ 60–75 tok/s im Q4_K_M, ≈ 45–55 tok/s im Q8_0. Ideal für einen 24/7-stillen Server.
- Radeon RX 7900 XTX 24 GB (ROCm)
- ≈ 45–60 tok/s. Ollama wird unterstützt, llama.cpp läuft mit ROCm/Vulkan.
- RTX 4070 Ti Super 16 GB (Q3_K_M)
- ≈ 50–65 tok/s, Kontext auf 4 k begrenzt. Auf diesem Niveau ist ein dichtes Qwen-14B-Modell oft weiterhin die sinnvollere Wahl.
#Nützliche Optimierungen
- 01Flash Attention aktivierenBei Ollama geschieht das auf neueren GPUs automatisch. Bei llama.cpp --flash-attn hinzufügen. Deutliche VRAM-Einsparung bereits ab 8 k Kontext.
- 02KV-Cache quantisierenllama.cpp unterstützt --cache-type-k q8_0 --cache-type-v q8_0. Das spart beim Cache etwa 30 % VRAM bei nahezu keinem Qualitätsverlust.
- 03Die Anzahl der aktiven Experten verringernEinige Varianten unterstützen --override-kv qwen3moe.expert_used_count=2 (statt der standardmäßigen 4 oder 8). Schneller, mit leichtem Qualitätsverlust.
- 04num_ctx auf den benötigten Wert begrenzen16 k reichen für die meisten Chats völlig aus. 32 k+ sind nur für die Zusammenfassung langer Dokumente gerechtfertigt.
- 05Für interaktiven Chat batch=1 bevorzugenMoE verliert bei großen Batches an Vorteil: Wenn Sie mehrere Benutzer gleichzeitig bedienen, ziehen Sie vLLM statt Ollama in Betracht.
#Fehlerbehebung
- OOM beim Laden auf RTX 4090
- Reduzieren Sie num_ctx auf 4096 und prüfen Sie, dass kein anderer GPU-Prozess läuft (Browser, Spiel). Q4_K_M sollte hineinpassen und dabei 2 bis 3 GB frei lassen.
- Generierung mit 5 Token pro Sekunde auf RTX 4090
- Das Modell wird teilweise auf die CPU ausgelagert. ollama ps wird eine Mischung aus CPU- und GPU-Nutzung anzeigen. Schließen Sie alles, starten Sie Ollama neu oder wechseln Sie zu Q3_K_M.
- Unkonsistente Antworten auf Französisch
- Prüfen Sie, ob Sie die Instruct-Variante und nicht die Base-Variante verwenden. Das MoE-Routing reagiert empfindlich auf die Formulierung des Systemprompts – formulieren Sie direkt.
- Erster Token sehr langsam (>10s)
- Lange Prompt-Evaluierungsphase: Das ist bei einem großen Kontext mit MoE zu erwarten. Verwenden Sie den Prompt-Cache zwischen Anfragen wieder (Option --prompt-cache von llama.cpp).
- Modell auf Ollama nicht auffindbar
- Der genaue Tag kann abweichen (qwen3.6 vs qwen3_6 vs qwen36). Suchen Sie auf ollama.com/library, bevor Sie den Befehl eingeben.
#Weiterführende Informationen
Jetzt, da Qwen3.6 35B-A3B bei Ihnen läuft, finden Sie hier einige Anregungen, um Ihr Setup weiter auszubauen:
- Quantisierung wählen (Q4, Q5, Q8, FP16)
- Um genau zu verstehen, was bei einem MoE-Modell zwischen Q3, Q4 und Q5 passiert.
- Open WebUI mit Ollama
- Eine ChatGPT-ähnliche Oberfläche mit Gesprächsverlauf und RAG für Ihr lokales Qwen3.6.
- GPU für lokale KI auswählen
- Wenn Sie bei einem solchen MoE-Modell mit 30B oder mehr zwischen einer gebrauchten 3090, einer 4090 und einer 5090 schwanken.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.