Welches LLM auf einer Radeon RX 7900 XT (20 GB) ?
Die Radeon RX 7900 XT (20 GB GDDR6, 800 GB/s, 315 W) lädt Modelle mit 24 bis 26 Milliarden Parametern in Q4 ohne Auslagerung in den Arbeitsspeicher und mit ausreichend Spielraum für den Kontext. Selbst ein 30B-Modell passt noch hinein, allerdings nur mit kurzem Kontext. Ihre Stärke ist der Speicher, nicht die Geschwindigkeit: Bei Llama 2 7B ergeben öffentlich verfügbare Messungen unter Vulkan 123 Tokens pro Sekunde, kaum mehr als bei einer RX 7800 XT mit 16 GB und deutlich weniger als bei der RX 7900 XTX.
Zwanzig Gigabyte VRAM sind bei einer Consumer-Grafikkarte eine seltene Speicherkapazität und verändern, welche Modelle sich ausführen lassen: Das ist der Unterschied zwischen einem 24B-Modell mit knappem Speicher und einem 24B-Modell mit Platz für Kontext. Dieser Leitfaden unterscheidet zwischen dem, was diese 20 GB tatsächlich bringen, und dem, was die Bandbreite von 800 GB/s erhoffen lässt. Dazu werden öffentliche Messungen zitiert und verbreitete Irrtümer über diese Karte korrigiert.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: Radeon RX 9070 XT 16 GB.
Warum diese Wahl? Unsere vollständige Übersicht zu Radeon RX 9070 XT 16 GB →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#Was eine RX 7900 XT im Jahr 2026 leistet
Die RX 7900 XT eignet sich für alle, die Modelle mit 24 bis 26 Milliarden Parametern nutzen möchten, ohne den Kontext einzuschränken. In ihre 20 GB passt Devstral Small 2 24B (etwa 14 GB in Q4) mit 6 GB Speicherreserve, gegenüber 1 GB auf einer Karte mit 16 GB, sowie das MoE-Modell Gemma 4 26B-A4B (etwa 16 GB) mit 4 GB Speicherreserve. Bei der Geschwindigkeit enttäuscht sie hingegen diejenigen, die auf ihre 800 GB/s setzen: 123,18 Tokens pro Sekunde beim 7B-Referenzmodell unter Vulkan, gegenüber 118,27 bei einer RX 7800 XT, deren Bandbreite um 22 % geringer ist. AMD führt sie offiziell in ROCm auf, und Ollama unterstützt sie unter Linux und Windows.
- Architektur
- RDNA 3, Navi 31 mit einem GCD und fünf MCD, veröffentlicht am 13. Dezember 2022.
- Berechnung
- 5.376 Stream-Prozessoren, 84 Recheneinheiten.
- Speicher
- 20 GB GDDR6, Busbreite 320 Bit, 800 GB/s
- Verbrauch
- 315 W Leistungsaufnahme der Grafikkarte: Prüfen Sie, welches Netzteil der Hersteller Ihres Modells empfiehlt.
- Preis
- Hier nicht angegeben: siehe /prix-gpu-ia.
#Das Speicherbudget von 20 GB
Rechnen Sie mit etwa 19 GB für das Modell und seinen KV-Cache, wenn die Grafikkarte nicht den Bildschirm ansteuert. Die Tabelle zieht die im QuelLLM-Katalog angegebene Modellgröße in Q4 von diesem Budget ab, um den verfügbaren Spielraum für den Kontext zu zeigen. Dieser Spielraum ist das entscheidende Kriterium: Ein Modell, das mit 1 GB verbleibendem Speicher „hineinpasst“, muss sich mit einem Kontext von wenigen Tausend Tokens begnügen.
| Modell | Modellgröße | Puffer für den Kontext | Fazit |
|---|---|---|---|
| gpt-oss 20B | ≈ 13 GB | ≈ 6 GB | Sehr komfortabel, langer Kontext |
| Devstral Small 2 24B | ≈ 14 GB | ≈ 5 GB | Komfortabel, langer Kontext möglich |
| Gemma 4 26B-A4B (MoE) | ≈ 16 GB | ≈ 3 GB | Passt in den Speicher, mittlere Kontextlänge |
| Granite 4.1 30B | ≈ 17 GB | ≈ 2 GB | Passt, kurzer Kontext |
| Gemma 4 31B | ≈ 18 GB | ≈ 1 GB | Eng begrenzt, sehr kurzer Kontext |
Modelle mit Experten verdienen eine Anmerkung. Bei einem MoE arbeitet nur ein Bruchteil der Parameter an jedem Token, wodurch die Generierung schneller ist als bei einem dichten Modell gleicher Größe. Dennoch müssen sämtliche Gewichte in den Speicher passen. Das 26B-A4B ist ein Modell, bei dem 20 GB den Unterschied machen: Mit Kontext ist es für 16 GB zu groß, in 20 GB passt es bequem. Ziehen Sie für noch größere Modelle wie die Familie Qwen3.6 35B-A3B den entsprechenden Leitfaden heran, statt zu raten: Die genaue Größe hängt von der gewählten Quantisierung ab.
Um den verbleibenden Speicher in eine Anzahl von Kontexttokens umzurechnen, muss der Speicherbedarf des KV-Caches pro Token bekannt sein. Dieser hängt von der Modellarchitektur ab: der Anzahl der Schichten, der Aufmerksamkeitsköpfe und der Präzision des Caches. Es gibt daher keine allgemeingültige Regel in Tokens pro Gigabyte. Die zuverlässige Methode ist die Messung: Laden Sie das Modell mit einem kleinen Kontextfenster, notieren Sie den belegten VRAM mit rocm-smi, vergrößern Sie das Fenster und wiederholen Sie den Vorgang. Der VRAM-Rechner der Website automatisiert diese Schätzung für die Modelle im Katalog, und die 8-Bit-Quantisierung des KV-Caches halbiert ungefähr den Speicherbedarf des Kontexts.
- Qwen3.6 35B-A3B lokal: Test und VRAM-Anforderungen
- Welcher LLM für 24 GB VRAM bei Modellen über 20 GB?
- KV-Cache quantisieren, um VRAM zu sparen
#Gemessene Durchsatzraten: Die Bandbreite ist nicht alles
Die Zahlen stammen aus öffentlichen Diskussionen im llama.cpp-Repository, in denen Llama 2 7B in Q4_0 und llama-bench verwendet werden; es handelt sich nicht um Messungen dieser Website. Unter Vulkan verarbeitet die RX 7900 XT einen Prompt mit 512 Tokens mit 2.941,58 Tokens pro Sekunde und generiert mit 123,18 Tokens pro Sekunde. Mit Flash Attention sind es 2.701,13 beziehungsweise 120,62 Tokens pro Sekunde. Unter ROCm nennt die Diskussion 3.098,38 Tokens pro Sekunde bei der Prompt-Verarbeitung und 116,15 bei der Generierung. Die beiden Messreihen kommen zu ähnlichen Ergebnissen: Die Generierungsrate erreicht ihre Obergrenze bei etwa 120 Tokens pro Sekunde.
Die theoretische Obergrenze aus der Speicherbandbreite von 800 GB/s, geteilt durch 3,82 GB Modellgewichte, liegt bei etwa 209 Tokens pro Sekunde; die Karte erreicht unter Vulkan nur 59 % davon. Das ist der niedrigste Wirkungsgrad unter den AMD-Karten dieser Messreihe (83 % bei einer RX 6700 XT, 77 % bei einer RX 7900 GRE, 72 % bei einer RX 7800 XT). Die wahrscheinliche Erklärung ist, dass ein Modell mit 7 Milliarden Parametern zu klein ist, um die Speicherbandbreite eines großen Chips voll auszuschöpfen; bei größeren Modellen lässt sich auf einen besseren Wirkungsgrad hoffen, doch keine Messung aus diesen Reihen belegt das, und es wäre unvorsichtig, Durchsatzwerte für ein 24B-Modell anzugeben.
| Backend | Flash Attention | Leseleistung pp512 | Generierung tg128 |
|---|---|---|---|
| Vulkan | nein | 2 941,58 t/s | 123,18 t/s |
| Vulkan | ja | 2 701,13 t/s | 120,62 t/s |
| ROCm | nein | 3 098,38 t/s | 116,15 t/s |
Um die Größenordnung bei großen Modellen abzuschätzen, lässt sich ein vorsichtiger Richtwert berechnen, indem man den gemessenen Wirkungsgrad von 59 % auf die theoretische Obergrenze anwendet: Bei einem 24B-Modell in Q4 mit 14 GB ergibt 800 geteilt durch 14 eine Obergrenze von etwa 57 Tokens pro Sekunde und damit ungefähr 34 Tokens pro Sekunde. Das ist eine Berechnung, keine Messung; wenn der Wirkungsgrad bei einem großen Modell besser ist, liegt der tatsächliche Durchsatz höher.
#Im Vergleich zur RX 7900 XTX: Der tatsächliche Unterschied ist viel größer, als gemeinhin behauptet wird
Man liest oft, dass die 7900 XT „10 bis 12 % langsamer“ sei als die 7900 XTX. Die öffentlich verfügbaren Messungen zeigen jedoch etwas anderes. Beim 7B-Referenzmodell unter Vulkan generiert die XTX 182,63 Tokens pro Sekunde, gegenüber 123,18 bei der XT: 48 % mehr. Das Verhältnis der Stream-Prozessoren (6.144 gegenüber 5.376) allein erklärt diesen Unterschied nicht; die Speicherbandbreite und der Chip vergrößern den Abstand. Der Vorteil der XT bleibt der Einstiegspreis: Mit 20 GB deckt sie die wesentlichen Anforderungen von Modellen mit 24 bis 26 Milliarden Parametern ab.
| Messung | RX 7900 XT | RX 7900 XTX |
|---|---|---|
| VRAM | 20 GB | 24 GB |
| Vulkan, Generation tg128 | 123,18 t/s | 182,63 t/s |
| Vulkan, Prompt-Verarbeitung pp512 | 2 941,58 t/s | 3 726,99 t/s |
Diese Korrektur verändert die Abwägung: Wenn Ihnen die Generierungsgeschwindigkeit wichtig ist, wiegt der Unterschied von 48 % schwerer als die zusätzlichen 4 GB VRAM. Wenn Sie dagegen vor allem Kapazität für den Kontext benötigen, bietet die XT bei einem 24B-Modell das Wesentliche dessen, was die XTX bietet. Bei einem Modell mit 30B oder mehr beseitigen die 24 GB der XTX hingegen die Kompromisse beim Kontext, und genau dann ist ihr Preisunterschied gerechtfertigt.
#Im Vergleich zur RTX 4070 Ti Super: mehr Speicher, weniger Geschwindigkeit
Die RTX 4070 Ti Super bietet 16 GB, also 4 GB weniger. Beim 7B-Referenzmodell unter Vulkan generiert sie 129,45 Tokens pro Sekunde, also 5 % mehr als die RX 7900 XT, und verarbeitet den Prompt mit 6.099 Tokens pro Sekunde, also doppelt so schnell. Die XT ist somit nicht „schneller“, wie man gelegentlich liest: Sie hat mehr Speicher. Ihr Vorteil ist die Speicherkapazität, die Modelle mit 24 bis 26 Milliarden Parametern samt Kontext ermöglicht.
| Kriterium | RX 7900 XT | RTX 4070 Ti Super |
|---|---|---|
| VRAM | 20 GB | 16 GB |
| Leseleistung pp512 | 2 941,58 t/s | 6 099,18 t/s |
| Generierung tg128 | 123,18 t/s | 129,45 t/s |
#Wenn ein Modell die 20 GB überschreitet
Ein zu großes Modell verursacht keinen Fehler: Ollama und llama.cpp legen so viele Schichten wie möglich auf die Grafikkarte und überlassen den Rest dem Prozessor. In llama.cpp legt die Option -ngl die Anzahl der Schichten fest, die auf die GPU ausgelagert werden, und der in den obigen Messungen verwendete Wert 100 bedeutet „alle“. Diesen Wert zu reduzieren gibt VRAM frei, verlangsamt aber die Generierung, da jedes Token dann den Systemspeicher durchlaufen muss, der deutlich langsamer als GDDR6 ist. Die Faustregel: Solange ollama ps 100 % GPU anzeigt, läuft die Generierung schnell; sobald ein Anteil beim Prozessor angezeigt wird, sinkt die Geschwindigkeit stufenweise.
#20 GB, 16 GB oder 24 GB: Wie man entscheidet
| Vorgesehener Einsatzzweck | 16 GB | 20 GB (RX 7900 XT) | 24 GB |
|---|---|---|---|
| Chat mit einem Modell mit 8 bis 14 Milliarden Parametern | Ausreichend | Unnötig | Unnötig |
| Code-Assistent 24B, langer Kontext | Knapp bemessen | Komfortabel | Komfortabel |
| MoE mit 26B und mittlerem Kontext | Zu knapp | Ausreichend | Ausreichend |
| Modell mit 30 bis 35 Milliarden Parametern und langem Kontext | Unmöglich | Knapp | Erforderlich |
Das Prinzip: Bezahlen Sie für die Kapazität, die Ihr größtes Modell benötigt, nicht für die, die Sie vielleicht eines Tages nutzen könnten. Wenn Sie ein 24B-Modell mit Kontext betreiben möchten, sind 20 GB die erste Kapazitätsstufe, ab der das komfortabel möglich ist; darüber hinaus muss jedes zusätzliche Gigabyte durch ein konkretes Modell gerechtfertigt sein.
#Erste Schritte
- 01Das System wählenAMD unterstützt die Radeon RX 7000 nur unter Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 und RHEL 9.7. Unter Windows verwendet Ollama einen ROCm-v7- oder HIP7-Stack; Vulkan dient als Ausweichlösung.
- 02Treiber und Ollama installierenUnter Linux benötigt Ollama den ROCm-Treiber v7. Installieren Sie ihn mit dem Dienstprogramm amdgpu-install und anschließend Ollama.
- 03Ein 24B-Modell ladenNehmen Sie einen Devstral Small 2 24B in Q4_K_M, starten Sie ihn und überprüfen Sie mit ollama ps, ob er den GPU auf 100 % auslastet.
- 04Kontext einstellenVergrößern Sie das Kontextfenster schrittweise und überwachen Sie dabei die VRAM-Auslastung: Das Ziel ist es, insgesamt unter 19 GB zu bleiben.
- 05Vulkan und ROCm vergleichenMessen Sie mit llama-bench und Ihrem Modell. Beide Backends liegen bei dieser Karte in den veröffentlichten Messungen nahe beieinander.
#Fazit 2026
- Eine gute Wahl
- Wenn Sie Modelle mit 24 bis 26 Milliarden Parametern samt Kontext ausführen möchten und der Preis pro GB VRAM auf /prix-gpu-ia günstig ist.
- Eine mittelmäßige Wahl
- Wenn es Ihnen vor allem auf Geschwindigkeit ankommt: Die Generierung erreicht höchstens ein Niveau nahe dem einer Grafikkarte mit 16 GB, und die RTX 4070 Ti Super verarbeitet Prompts doppelt so schnell.
- Eine unzureichende Wahl
- Für Modelle mit 30 bis 35 Milliarden Parametern und langem Kontext, bei denen 24 GB erforderlich werden.
- Preise für Grafikkarten für lokale KI, zweimal wöchentlich erfasst
- Ollama-Dokumentation: Unterstützte AMD-Grafikkarten
- ROCm-GPU-Kompatibilität, AMD-Dokumentation
- Vulkan-Scoreboard im llama.cpp-Repository
#Häufig gestellte Fragen
Ist die RX 7900 XT gut für lokale LLM geeignet?+
RX 7900 XT oder RX 7900 XTX für lokale KI?+
Reichen 20 GB VRAM aus, um ein 30B-Modell zu betreiben?+
Wie viele Tokens pro Sekunde erzeugt eine RX 7900 XT?+
RX 7900 XT oder RTX 4070 Ti Super für ein LLM?+
Funktioniert die RX 7900 XT mit Ollama unter Windows?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.