Startseite › Katalog › Bestes LLM auf der Radeon RX 7900 XT (20 GB) im Jahr 2026

Bestes LLM auf der Radeon RX 7900 XT (20 GB) im Jahr 2026

◆ Lokale KI — Ihr privates und kostenloses ChatGPT, auf Ihrem Rechner, in 1 h · 24 € · oder alle Kits für 49 € →

Ranking aktualisiert am 22.09.2026

Die Radeon RX 7900 XT (20 GB GDDR6, 800 GB/s) ist die jüngere Schwester der 7900 XTX. Die ungewöhnlichen 20 GB ermöglichen den komfortablen Einsatz von Modellen mit 24–32 Milliarden Parametern in Q4. Neu ca. 650 €, hervorragendes Preis-Leistungs-Verhältnis.

Angebote und Alternativen für lokale KI

Radeon RX 7900 XT : Kaufalternative für lokale KI verfügbar — Radeon RX 9070 XT 16 GB :

Warum diese Wahl? Unser vollständiger Artikel zur Radeon RX 9070 XT 16 GB →

Welchen PC sollten Sie je nach Budget wählen? Unsere Auswahl von 800 bis 3 500 € →

Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass Ihnen Mehrkosten entstehen. Dies beeinflusst die unabhängig erstellte Rangliste nicht. Als Amazon-Partner verdient QuelLLM an qualifizierten Käufen.

Rangliste

1

🇨🇳 LLaDA 2.0 Uni 16B

Ant Group / inclusionAI · 16 Milliarden Parameter · Apache 2.0 · 8 192 Tokens ctx

Erstes offenes dLLM unter Apache 2.0: MoE 16B/1B + Diffusionsdecoder mit 6,2B Parametern. Text und Vision in einem einheitlichen Modell. Veröffentlicht am 22. April 2026.

Warum dieser Rang Erstes offenes dLLM unter Apache 2.0: MoE 16B/1B + Diffusionsdecoder mit 6,2B Parametern. Text und Vision in einem einheitlichen Modell. Veröffentlicht am 22. April 2026.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
auf Radeon RX 7900 XT
Q4_K_M
18 GB · 60 Tok/s
2

🇫🇷 Devstral Small 2 24B

Mistral AI · 24 Milliarden Parameter · Apache 2.0 · 256 000 Tokens ctx

Coding-Spezialist mit 24B unter Apache 2.0. 72,2 % SWE-Bench. 256k ctx, französisches Labor.

Warum dieser Rang Coding-Spezialist mit 24B unter Apache 2.0. 72,2 % SWE-Bench. 256k ctx, französisches Labor.
ollama run devstral-small2:24b
auf Radeon RX 7900 XT
Q5_K_M
17 GB · 15 tok/s
3

🇺🇸 Gemma 4 26B-A4B MoE

Google · 26B Parameter · Apache 2.0 · Kontext: 128 000 Tokens

MoE-Variante von Gemma 4. 26B Parameter, davon 4B aktiv. Vollständig multimodal (Text+Bild+Audio).

Warum dieser Rang MoE-Variante von Gemma 4. 26B Parameter, davon 4B aktiv. Vollständig multimodal (Text+Bild+Audio).
ollama run gemma4:26b
auf Radeon RX 7900 XT
Q5_K_M
19 GB · 22 tok/s
4

🇨🇳 Qwen 3.6 27B

Alibaba · 27B Parameter · Apache 2.0 · 262 144 tokens ctx

Dichtes multimodales 27B-Modell, veröffentlicht am 22. April 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.

Warum dieser Rang Dichtes multimodales 27B-Modell, veröffentlicht am 22. April 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
auf Radeon RX 7900 XT
Q5_K_M
19 GB · 13 tok/s
5

🇨🇳 Qwen 3.8 27B

Alibaba · 27B Parameter · Apache 2.0 · 262 144 tokens ctx

Qwen 3.8 27B: dichtes multimodales Modell (Text + Vision), 262k Kontext, ca. 16 GB VRAM bei Q4 (18 GB Ollama-Gewichte). Apache 2.0, agentisches Programmieren und Vision.

Warum dieser Rang Qwen 3.8 27B: dichtes multimodales Modell (Text + Vision), 262k Kontext, ca. 16 GB VRAM bei Q4 (18 GB Ollama-Gewichte). Apache 2.0, agentisches Programmieren und Vision.
ollama run qwen3.8:27b
auf Radeon RX 7900 XT
Q5_K_M
19 GB · 14 Tok/s
6

🇫🇷 Magistral Small 24B

Mistral AI · 24 Milliarden Parameter · Apache 2.0 · Kontext: 128 000 Tokens

Erster offener Reasoner von Mistral. AIME24 70.7%. Basis Small 3.1 + CoT-Training.

Warum dieser Rang Erster offener Reasoner von Mistral. AIME24 70.7%. Basis Small 3.1 + CoT-Training.
ollama run magistral:24b
auf Radeon RX 7900 XT
Q5_K_M
17 GB · 15 tok/s
7

🇺🇸 Gemma 4 31B

Google · 31B Parameter · Apache 2.0 · 256 000 Tokens ctx

Dichtes multimodales 31B-Modell (Text+Bild+Audio). 140+ Sprachen, 256k Kontext. Platz 3 in der Chatbot Arena unter den offenen Modellen.

Warum dieser Rang Dichtes multimodales 31B-Modell (Text+Bild+Audio). 140+ Sprachen, 256k Kontext. Platz 3 in der Chatbot Arena unter den offenen Modellen.
ollama run gemma4:31b
auf Radeon RX 7900 XT
Q4_K_M
18 GB · 12 Tok/s

Vergleichstabelle

Rang Modell Params VRAM Q4 Kontext Lizenz auf Radeon RX 7900 XT
#1 LLaDA 2.0 Uni 16B 16B 18 GB 8 192 Apache 2.0 60 Tok/s · Q4_K_M
#2 Devstral Small 2 24B 24B 14 GB 256 000 Apache 2.0 15 Tok/s · Q5_K_M
#3 Gemma 4 26B-A4B MoE 26B 16 GB 128 000 Apache 2.0 22 tok/s · Q5_K_M
#4 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0 13 Tok/s · Q5_K_M
#5 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0 14 Tok/s · Q5_K_M
#6 Magistral Small 24B 24B 14 GB 128 000 Apache 2.0 15 Tok/s · Q5_K_M
#7 Gemma 4 31B 31B 18 GB 256 000 Apache 2.0 12 tok/s · Q4_K_M
Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Kostenloses Memo

Welches Code-Modell lässt sich auf IHREM Rechner ausführen?

Memo erhalten VRAM → bestes Code-Modell → Ollama-Befehl (alles auf einem Bildschirm, zum Kopieren und Einfügen). Und wechseln Sie zum Kit Copilote Local, um daraus ein wirklich funktionierendes Setup zu machen.

Das Kit „Copilote Local“ — die Ollama- + Cline- + Aider-Configs zum direkten Einfügen, angepasste Modelfiles, Hilfe bei Problemen, lebenslanger Zugang zum Onlinebereich →

Kein Spam. Abmeldung mit 1 Klick. Ihre Daten bleiben bei uns (werden nie weiterverkauft).

Methodik des Rankings

Filter: Q4_K_M ≤ 18 GB. Bonus 13-32B (Peak 20 GB). 800 GB/s + ROCm 6.

Berücksichtigte Kriterien:

  • Q4_K_M ≤ 18 GB
  • Mit ROCm 6 kompatibel
  • Mistral Small 24B Q5
  • Ungewöhnliche 20 GB

Die Bewertung ist vollständig transparent: konsultieren Sie unsere Methodik für Details zur Berechnung des VRAM-Bedarfs und der Tokens pro Sekunde.

Häufige Fragen

RX 7900 XT gegen 7900 XTX?

XT = 20 GB + 800 GB/s. XTX = 24 GB + 960 GB/s. Für 24-32B Q4 eignen sich beide. XTX ist vorzuziehen für Fine-Tuning oder 32B Q5. Siehe RX 7900 XTX.

Warum 20 GB und nicht 16 oder 24?

Eine Marketingentscheidung von AMD zur Positionierung zwischen der 7900 XTX und der vorherigen Leistungsklasse. Für LLMs ist das ein guter Mittelweg: Mistral Small 24B Q4 (~13 GB) + 32k Kontext + Cache = ~18 GB.

ROCm auf der 7900 XT: einfach?

Ja, seit ROCm 6 (2024). Ollama bietet native Unterstützung über -gpu rocm. llama.cpp ebenfalls. Einfacher als vor 2 Jahren. Siehe guide.

LLM-Sweet-Spot für die 7900 XT?

Mistral Small 24B Q5 (~17 GB) mit 25 Tok/s, Qwen 3 32B Q4 (~17 GB) mit 22 Tok/s. Sehr gut für Code und Chat.

Weiterführende Informationen

Die QuelLLM-Pakete Der maßgebliche Leitfaden für jeden Anwendungsfall
Alle Kits lebenslang — 49 €