🇺🇸 Gemma 4 26B-A4B MoE
MoE-Variante von Gemma 4. 26B Parameter, davon 4B aktiv. Vollständig multimodal (Text+Bild+Audio).
ollama run gemma4:26b
Ranking aktualisiert am 22.09.2026
Die Radeon RX 7900 XTX (24 GB GDDR6, 960 GB/s) ist die AMD-Alternative zur RTX 4090. 24 GB + ähnliche Bandbreite = gleiche Möglichkeiten hinsichtlich des VRAM. Kompatibel mit ROCm 6 + llama.cpp/Ollama.
Radeon RX 7900 XTX : Kaufalternative für lokale KI verfügbar — Radeon RX 9070 XT 16 GB :
Warum diese Wahl? Unser vollständiger Artikel zur Radeon RX 9070 XT 16 GB →
Welchen PC sollten Sie je nach Budget wählen? Unsere Auswahl von 800 bis 3 500 € →
Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass Ihnen Mehrkosten entstehen. Dies beeinflusst die unabhängig erstellte Rangliste nicht. Als Amazon-Partner verdient QuelLLM an qualifizierten Käufen.
MoE-Variante von Gemma 4. 26B Parameter, davon 4B aktiv. Vollständig multimodal (Text+Bild+Audio).
ollama run gemma4:26b
Erstes offenes dLLM unter Apache 2.0: MoE 16B/1B + Diffusionsdecoder mit 6,2B Parametern. Text und Vision in einem einheitlichen Modell. Veröffentlicht am 22. April 2026.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Dichtes multimodales 27B-Modell, veröffentlicht am 22. April 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Qwen 3.8 27B: dichtes multimodales Modell (Text + Vision), 262k Kontext, ca. 16 GB VRAM bei Q4 (18 GB Ollama-Gewichte). Apache 2.0, agentisches Programmieren und Vision.
ollama run qwen3.8:27b
GLM-4.7-Flash (MoE mit 31B Parametern, davon ~3B aktiv): das beste Verhältnis von Code-Leistung zu VRAM-Bedarf in der 30B-Klasse. MIT, 128k ctx, sehr schnell auf 3090/4090.
ollama run glm-4.7-flash
Dichtes multimodales 31B-Modell (Text+Bild+Audio). 140+ Sprachen, 256k Kontext. Platz 3 in der Chatbot Arena unter den offenen Modellen.
ollama run gemma4:31b
Dichtes 30B-Modell unter Apache 2.0, 12 Sprachen einschließlich Französisch, 131k ctx, GQA 32Q/8KV. OpenAI-kompatibles Tool Calling. Veröffentlicht am 29. April 2026.
ollama run granite4.1:30b
MoE mit 30B/3B aktiven Parametern: Thinking-Modus + Instruct. Goldmedaille bei der IMO 2025 und der IOI 2025. Schnelle Inferenz dank 3B aktiver Parameter, Reasoning-Fähigkeiten auf 30B-Niveau. Veröffentlichung im April 2026.
ollama run nemotron-cascade-2
| Rang | Modell | Params | VRAM Q4 | Kontext | Lizenz | Auf Radeon RX 7900 XTX |
|---|---|---|---|---|---|---|
| #1 | Gemma 4 26B-A4B MoE | 26B | 16 GB | 128 000 | Apache 2.0 | 22 tok/s · Q5_K_M |
| #2 | LLaDA 2.0 Uni 16B | 16B | 18 GB | 8 192 | Apache 2.0 | 60 Tok/s · Q5_K_M |
| #3 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 | 13 Tok/s · Q5_K_M |
| #4 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 | 14 Tok/s · Q5_K_M |
| #5 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT | 40 tok/s · Q5_K_M |
| #6 | Gemma 4 31B | 31B | 18 GB | 256 000 | Apache 2.0 | 12 tok/s · Q5_K_M |
| #7 | Granite 4.1 30B Instruct | 30B | 17 GB | 131 072 | Apache 2.0 | 12 tok/s · Q5_K_M |
| #8 | Nemotron Cascade 2 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA Open Model License | 30 tok/s · Q5_K_M |
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
Kostenloses Memo
Memo erhalten VRAM → bestes Code-Modell → Ollama-Befehl (alles auf einem Bildschirm, zum Kopieren und Einfügen). Und wechseln Sie zum Kit Copilote Local, um daraus ein wirklich funktionierendes Setup zu machen.
Das Kit „Copilote Local“ — die Ollama- + Cline- + Aider-Configs zum direkten Einfügen, angepasste Modelfiles, Hilfe bei Problemen, lebenslanger Zugang zum Onlinebereich →Kein Spam. Abmeldung mit 1 Klick. Ihre Daten bleiben bei uns (werden nie weiterverkauft).
Ihre Karte → das beste Code-Modell für die lokale Ausführung und der exakte Ollama-Befehl:
| Ihr VRAM | Typische GPUs / Macs | Empfohlenes Code-Modell | Ollama-Befehl |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) oder Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — Code-Agent-Spezialist | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — „nahe an Copilot“ | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — schnelles MoE | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — das ist in diesem speziellen Fall immer noch der Referenzstandard. ⚠️ Qwen 3.8: sein Reasoning ist standardmäßig sehr hoch eingestellt, und es „denkt“ bei einfachen Anfragen zu viel nach — stellen Sie es auf low (oder schalten Sie es ab) beim ersten Start. ⚠️ Lizenzfalle: Codestral 22B = Mistral Non-Production License → zum Programmieren bei der Arbeit verboten. Qwen 3.5/3.8, Gemma 4 und Devstral sind unter Apache 2.0 lizenziert. 💡 Abstürze wegen Speicherproblemen? Halten Sie ca. 1,5 GB VRAM für den Kontext frei oder gehen Sie eine Quantisierungsstufe herunter.🔌 Zum Einbinden in VS Code: Cline (Agent für mehrere Dateien), Aider (CLI) oder Tabby/Twinny (FIM-Autovervollständigung) — alle verbinden sich lokal mit Ollama. Das Kit Lokaler Copilot — Configs zum Einfügen + getestetes Setup — ist verfügbar: /copilote-local.
Filter: Q4_K_M ≤ 22 GB. Bonus für 13–32B (Spitzenbedarf 24 GB). 960 GB/s GDDR6 + ausgereiftes ROCm 6.
Berücksichtigte Kriterien:
Die Bewertung ist vollständig transparent: konsultieren Sie unsere Methodik für Details zur Berechnung des VRAM-Bedarfs und der Tokens pro Sekunde.
RX 7900 XTX im Vergleich zu RTX 4090?
Ebenfalls 24 GB. 7900 XTX 960 GB/s vs. 4090 1008 GB/s = nahezu identische Bandbreite. CUDA wird jedoch weiterhin besser unterstützt (Ollama, vLLM, ExLlamaV2). Die 4090 ist in der Praxis etwa 30–50 % schneller. Siehe RTX 4090.
Ist ROCm im Jahr 2026 zuverlässig?
Ja, Ollama unterstützt AMD in Kombination mit der stabilen Version von ROCm 6 nativ. llama.cpp mit ROCm läuft gut. vLLM auf AMD macht Fortschritte, ist aber weniger ausgereift als CUDA. Für Ollama und Chats funktioniert das gut. Siehe guide.
Preis der RX 7900 XTX im Jahr 2026?
~750–900 € neu, ~600–700 € gebraucht. Hervorragendes Verhältnis von Preis zu VRAM-Kapazität (€/GB) im Vergleich zu einer neuen RTX 4090 (~1500 €) oder einer gebrauchten RTX 3090 (~650 €).
Llama 70B auf 7900 XTX?
Q4 (~40 GB) hält nicht. Q3 (~32 GB) hält nicht. Q2 (~24 GB) hält gerade, aber die Qualität ist verschlechtert. Für einen fluiden 70B-Modus sollten 2× 7900 XTX oder Mac Studio verwendet werden. Weitere Informationen finden Sie bei Mac Studio.