Startseite › Katalog › Bestes LLM auf der Radeon RX 7900 XTX (24 GB) im Jahr 2026

Bestes LLM auf der Radeon RX 7900 XTX (24 GB) im Jahr 2026

◆ Lokale KI — Ihr privates und kostenloses ChatGPT, auf Ihrem Rechner, in 1 h · 24 € · oder alle Kits für 49 € →

Ranking aktualisiert am 22.09.2026

Die Radeon RX 7900 XTX (24 GB GDDR6, 960 GB/s) ist die AMD-Alternative zur RTX 4090. 24 GB + ähnliche Bandbreite = gleiche Möglichkeiten hinsichtlich des VRAM. Kompatibel mit ROCm 6 + llama.cpp/Ollama.

Angebote und Alternativen für lokale KI

Radeon RX 7900 XTX : Kaufalternative für lokale KI verfügbar — Radeon RX 9070 XT 16 GB :

Warum diese Wahl? Unser vollständiger Artikel zur Radeon RX 9070 XT 16 GB →

Welchen PC sollten Sie je nach Budget wählen? Unsere Auswahl von 800 bis 3 500 € →

Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass Ihnen Mehrkosten entstehen. Dies beeinflusst die unabhängig erstellte Rangliste nicht. Als Amazon-Partner verdient QuelLLM an qualifizierten Käufen.

Rangliste

1

🇺🇸 Gemma 4 26B-A4B MoE

Google · 26B Parameter · Apache 2.0 · Kontext: 128 000 Tokens

MoE-Variante von Gemma 4. 26B Parameter, davon 4B aktiv. Vollständig multimodal (Text+Bild+Audio).

Warum dieser Rang MoE-Variante von Gemma 4. 26B Parameter, davon 4B aktiv. Vollständig multimodal (Text+Bild+Audio).
ollama run gemma4:26b
Auf Radeon RX 7900 XTX
Q5_K_M
19 GB · 22 tok/s
2

🇨🇳 LLaDA 2.0 Uni 16B

Ant Group / inclusionAI · 16 Milliarden Parameter · Apache 2.0 · 8 192 Tokens ctx

Erstes offenes dLLM unter Apache 2.0: MoE 16B/1B + Diffusionsdecoder mit 6,2B Parametern. Text und Vision in einem einheitlichen Modell. Veröffentlicht am 22. April 2026.

Warum dieser Rang Erstes offenes dLLM unter Apache 2.0: MoE 16B/1B + Diffusionsdecoder mit 6,2B Parametern. Text und Vision in einem einheitlichen Modell. Veröffentlicht am 22. April 2026.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Auf Radeon RX 7900 XTX
Q5_K_M
22 GB · 60 tok/s
3

🇨🇳 Qwen 3.6 27B

Alibaba · 27B Parameter · Apache 2.0 · 262 144 tokens ctx

Dichtes multimodales 27B-Modell, veröffentlicht am 22. April 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.

Warum dieser Rang Dichtes multimodales 27B-Modell, veröffentlicht am 22. April 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Auf Radeon RX 7900 XTX
Q5_K_M
19 GB · 13 tok/s
4

🇨🇳 Qwen 3.8 27B

Alibaba · 27B Parameter · Apache 2.0 · 262 144 tokens ctx

Qwen 3.8 27B: dichtes multimodales Modell (Text + Vision), 262k Kontext, ca. 16 GB VRAM bei Q4 (18 GB Ollama-Gewichte). Apache 2.0, agentisches Programmieren und Vision.

Warum dieser Rang Qwen 3.8 27B: dichtes multimodales Modell (Text + Vision), 262k Kontext, ca. 16 GB VRAM bei Q4 (18 GB Ollama-Gewichte). Apache 2.0, agentisches Programmieren und Vision.
ollama run qwen3.8:27b
Auf Radeon RX 7900 XTX
Q5_K_M
19 GB · 14 Tok/s
5

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31B Parameter · MIT · Kontext: 128 000 Tokens

GLM-4.7-Flash (MoE mit 31B Parametern, davon ~3B aktiv): das beste Verhältnis von Code-Leistung zu VRAM-Bedarf in der 30B-Klasse. MIT, 128k ctx, sehr schnell auf 3090/4090.

Warum dieser Rang GLM-4.7-Flash (MoE mit 31B Parametern, davon ~3B aktiv): das beste Verhältnis von Code-Leistung zu VRAM-Bedarf in der 30B-Klasse. MIT, 128k ctx, sehr schnell auf 3090/4090.
ollama run glm-4.7-flash
Auf Radeon RX 7900 XTX
Q5_K_M
23 GB · 40 tok/s
6

🇺🇸 Gemma 4 31B

Google · 31B Parameter · Apache 2.0 · 256 000 Tokens ctx

Dichtes multimodales 31B-Modell (Text+Bild+Audio). 140+ Sprachen, 256k Kontext. Platz 3 in der Chatbot Arena unter den offenen Modellen.

Warum dieser Rang Dichtes multimodales 31B-Modell (Text+Bild+Audio). 140+ Sprachen, 256k Kontext. Platz 3 in der Chatbot Arena unter den offenen Modellen.
ollama run gemma4:31b
Auf Radeon RX 7900 XTX
Q5_K_M
22 GB · 12 tok/s
7

🇺🇸 Granite 4.1 30B Instruct

IBM · 30B Parameter · Apache 2.0 · Kontext: 131 072 Tokens

Dichtes 30B-Modell unter Apache 2.0, 12 Sprachen einschließlich Französisch, 131k ctx, GQA 32Q/8KV. OpenAI-kompatibles Tool Calling. Veröffentlicht am 29. April 2026.

Warum dieser Rang Dichtes 30B-Modell unter Apache 2.0, 12 Sprachen einschließlich Französisch, 131k ctx, GQA 32Q/8KV. OpenAI-kompatibles Tool Calling. Veröffentlicht am 29. April 2026.
ollama run granite4.1:30b
Auf Radeon RX 7900 XTX
Q5_K_M
21 GB · 12 tok/s
8

🇺🇸 Nemotron Cascade 2 30B-A3B

NVIDIA · 30B Parameter · NVIDIA Open Model License · Kontext: 128 000 Tokens

MoE mit 30B/3B aktiven Parametern: Thinking-Modus + Instruct. Goldmedaille bei der IMO 2025 und der IOI 2025. Schnelle Inferenz dank 3B aktiver Parameter, Reasoning-Fähigkeiten auf 30B-Niveau. Veröffentlichung im April 2026.

Warum dieser Rang MoE mit 30B/3B aktiven Parametern: Thinking-Modus + Instruct. Goldmedaille bei der IMO 2025 und der IOI 2025. Schnelle Inferenz dank 3B aktiver Parameter, Reasoning-Fähigkeiten auf 30B-Niveau. Veröffentlichung im April 2026.
ollama run nemotron-cascade-2
Auf Radeon RX 7900 XTX
Q5_K_M
21 GB · 30 tok/s

Vergleichstabelle

Rang Modell Params VRAM Q4 Kontext Lizenz Auf Radeon RX 7900 XTX
#1 Gemma 4 26B-A4B MoE 26B 16 GB 128 000 Apache 2.0 22 tok/s · Q5_K_M
#2 LLaDA 2.0 Uni 16B 16B 18 GB 8 192 Apache 2.0 60 Tok/s · Q5_K_M
#3 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0 13 Tok/s · Q5_K_M
#4 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0 14 Tok/s · Q5_K_M
#5 GLM 4.7 Flash 31B 19 GB 128 000 MIT 40 tok/s · Q5_K_M
#6 Gemma 4 31B 31B 18 GB 256 000 Apache 2.0 12 tok/s · Q5_K_M
#7 Granite 4.1 30B Instruct 30B 17 GB 131 072 Apache 2.0 12 tok/s · Q5_K_M
#8 Nemotron Cascade 2 30B-A3B 30B 17 GB 128 000 NVIDIA Open Model License 30 tok/s · Q5_K_M
Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Kostenloses Memo

Welches Code-Modell lässt sich auf IHREM Rechner ausführen?

Memo erhalten VRAM → bestes Code-Modell → Ollama-Befehl (alles auf einem Bildschirm, zum Kopieren und Einfügen). Und wechseln Sie zum Kit Copilote Local, um daraus ein wirklich funktionierendes Setup zu machen.

Das Kit „Copilote Local“ — die Ollama- + Cline- + Aider-Configs zum direkten Einfügen, angepasste Modelfiles, Hilfe bei Problemen, lebenslanger Zugang zum Onlinebereich →

Kein Spam. Abmeldung mit 1 Klick. Ihre Daten bleiben bei uns (werden nie weiterverkauft).

Methodik des Rankings

Filter: Q4_K_M ≤ 22 GB. Bonus für 13–32B (Spitzenbedarf 24 GB). 960 GB/s GDDR6 + ausgereiftes ROCm 6.

Berücksichtigte Kriterien:

  • Q4_K_M ≤ 22 GB
  • Mit ROCm 6 kompatibel
  • Qwen 3 32B Q5 läuft flüssig
  • 24 GB für den Preis einer 4070 Ti Super

Die Bewertung ist vollständig transparent: konsultieren Sie unsere Methodik für Details zur Berechnung des VRAM-Bedarfs und der Tokens pro Sekunde.

Häufige Fragen

RX 7900 XTX im Vergleich zu RTX 4090?

Ebenfalls 24 GB. 7900 XTX 960 GB/s vs. 4090 1008 GB/s = nahezu identische Bandbreite. CUDA wird jedoch weiterhin besser unterstützt (Ollama, vLLM, ExLlamaV2). Die 4090 ist in der Praxis etwa 30–50 % schneller. Siehe RTX 4090.

Ist ROCm im Jahr 2026 zuverlässig?

Ja, Ollama unterstützt AMD in Kombination mit der stabilen Version von ROCm 6 nativ. llama.cpp mit ROCm läuft gut. vLLM auf AMD macht Fortschritte, ist aber weniger ausgereift als CUDA. Für Ollama und Chats funktioniert das gut. Siehe guide.

Preis der RX 7900 XTX im Jahr 2026?

~750–900 € neu, ~600–700 € gebraucht. Hervorragendes Verhältnis von Preis zu VRAM-Kapazität (€/GB) im Vergleich zu einer neuen RTX 4090 (~1500 €) oder einer gebrauchten RTX 3090 (~650 €).

Llama 70B auf 7900 XTX?

Q4 (~40 GB) hält nicht. Q3 (~32 GB) hält nicht. Q2 (~24 GB) hält gerade, aber die Qualität ist verschlechtert. Für einen fluiden 70B-Modus sollten 2× 7900 XTX oder Mac Studio verwendet werden. Weitere Informationen finden Sie bei Mac Studio.

Weiterführende Informationen

Die QuelLLM-Pakete Der maßgebliche Leitfaden für jeden Anwendungsfall
Alle Kits lebenslang — 49 €