Mittelstufe 11 Min.Radeon RX 7000

Welches LLM auf einer Radeon RX 7900 XT (20 GB) ?

Direkte Antwort

Die Radeon RX 7900 XT (20 GB GDDR6, 800 GB/s, 315 W) lädt Modelle mit 24 bis 26 Milliarden Parametern in Q4 ohne Auslagerung in den Arbeitsspeicher und mit ausreichend Spielraum für den Kontext. Selbst ein 30B-Modell passt noch hinein, allerdings nur mit kurzem Kontext. Ihre Stärke ist der Speicher, nicht die Geschwindigkeit: Bei Llama 2 7B ergeben öffentlich verfügbare Messungen unter Vulkan 123 Tokens pro Sekunde, kaum mehr als bei einer RX 7800 XT mit 16 GB und deutlich weniger als bei der RX 7900 XTX.

Zwanzig Gigabyte VRAM sind bei einer Consumer-Grafikkarte eine seltene Speicherkapazität und verändern, welche Modelle sich ausführen lassen: Das ist der Unterschied zwischen einem 24B-Modell mit knappem Speicher und einem 24B-Modell mit Platz für Kontext. Dieser Leitfaden unterscheidet zwischen dem, was diese 20 GB tatsächlich bringen, und dem, was die Bandbreite von 800 GB/s erhoffen lässt. Dazu werden öffentliche Messungen zitiert und verbreitete Irrtümer über diese Karte korrigiert.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Kaufalternative für diesen Guide: Radeon RX 9070 XT 16 GB.

Warum diese Wahl? Unsere vollständige Übersicht zu Radeon RX 9070 XT 16 GB →

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#Was eine RX 7900 XT im Jahr 2026 leistet

Die RX 7900 XT eignet sich für alle, die Modelle mit 24 bis 26 Milliarden Parametern nutzen möchten, ohne den Kontext einzuschränken. In ihre 20 GB passt Devstral Small 2 24B (etwa 14 GB in Q4) mit 6 GB Speicherreserve, gegenüber 1 GB auf einer Karte mit 16 GB, sowie das MoE-Modell Gemma 4 26B-A4B (etwa 16 GB) mit 4 GB Speicherreserve. Bei der Geschwindigkeit enttäuscht sie hingegen diejenigen, die auf ihre 800 GB/s setzen: 123,18 Tokens pro Sekunde beim 7B-Referenzmodell unter Vulkan, gegenüber 118,27 bei einer RX 7800 XT, deren Bandbreite um 22 % geringer ist. AMD führt sie offiziell in ROCm auf, und Ollama unterstützt sie unter Linux und Windows.

Architektur
RDNA 3, Navi 31 mit einem GCD und fünf MCD, veröffentlicht am 13. Dezember 2022.
Berechnung
5.376 Stream-Prozessoren, 84 Recheneinheiten.
Speicher
20 GB GDDR6, Busbreite 320 Bit, 800 GB/s
Verbrauch
315 W Leistungsaufnahme der Grafikkarte: Prüfen Sie, welches Netzteil der Hersteller Ihres Modells empfiehlt.
Preis
Hier nicht angegeben: siehe /prix-gpu-ia.

#Das Speicherbudget von 20 GB

Rechnen Sie mit etwa 19 GB für das Modell und seinen KV-Cache, wenn die Grafikkarte nicht den Bildschirm ansteuert. Die Tabelle zieht die im QuelLLM-Katalog angegebene Modellgröße in Q4 von diesem Budget ab, um den verfügbaren Spielraum für den Kontext zu zeigen. Dieser Spielraum ist das entscheidende Kriterium: Ein Modell, das mit 1 GB verbleibendem Speicher „hineinpasst“, muss sich mit einem Kontext von wenigen Tausend Tokens begnügen.

Was auf einer 7900 XT in Q4 Platz findet (nur Modellgewichte, Speicherbudget von 19 GB)
ModellModellgrößePuffer für den KontextFazit
gpt-oss 20B≈ 13 GB≈ 6 GBSehr komfortabel, langer Kontext
Devstral Small 2 24B≈ 14 GB≈ 5 GBKomfortabel, langer Kontext möglich
Gemma 4 26B-A4B (MoE)≈ 16 GB≈ 3 GBPasst in den Speicher, mittlere Kontextlänge
Granite 4.1 30B≈ 17 GB≈ 2 GBPasst, kurzer Kontext
Gemma 4 31B≈ 18 GB≈ 1 GBEng begrenzt, sehr kurzer Kontext

Modelle mit Experten verdienen eine Anmerkung. Bei einem MoE arbeitet nur ein Bruchteil der Parameter an jedem Token, wodurch die Generierung schneller ist als bei einem dichten Modell gleicher Größe. Dennoch müssen sämtliche Gewichte in den Speicher passen. Das 26B-A4B ist ein Modell, bei dem 20 GB den Unterschied machen: Mit Kontext ist es für 16 GB zu groß, in 20 GB passt es bequem. Ziehen Sie für noch größere Modelle wie die Familie Qwen3.6 35B-A3B den entsprechenden Leitfaden heran, statt zu raten: Die genaue Größe hängt von der gewählten Quantisierung ab.

Um den verbleibenden Speicher in eine Anzahl von Kontexttokens umzurechnen, muss der Speicherbedarf des KV-Caches pro Token bekannt sein. Dieser hängt von der Modellarchitektur ab: der Anzahl der Schichten, der Aufmerksamkeitsköpfe und der Präzision des Caches. Es gibt daher keine allgemeingültige Regel in Tokens pro Gigabyte. Die zuverlässige Methode ist die Messung: Laden Sie das Modell mit einem kleinen Kontextfenster, notieren Sie den belegten VRAM mit rocm-smi, vergrößern Sie das Fenster und wiederholen Sie den Vorgang. Der VRAM-Rechner der Website automatisiert diese Schätzung für die Modelle im Katalog, und die 8-Bit-Quantisierung des KV-Caches halbiert ungefähr den Speicherbedarf des Kontexts.

#Gemessene Durchsatzraten: Die Bandbreite ist nicht alles

Die Zahlen stammen aus öffentlichen Diskussionen im llama.cpp-Repository, in denen Llama 2 7B in Q4_0 und llama-bench verwendet werden; es handelt sich nicht um Messungen dieser Website. Unter Vulkan verarbeitet die RX 7900 XT einen Prompt mit 512 Tokens mit 2.941,58 Tokens pro Sekunde und generiert mit 123,18 Tokens pro Sekunde. Mit Flash Attention sind es 2.701,13 beziehungsweise 120,62 Tokens pro Sekunde. Unter ROCm nennt die Diskussion 3.098,38 Tokens pro Sekunde bei der Prompt-Verarbeitung und 116,15 bei der Generierung. Die beiden Messreihen kommen zu ähnlichen Ergebnissen: Die Generierungsrate erreicht ihre Obergrenze bei etwa 120 Tokens pro Sekunde.

Die theoretische Obergrenze aus der Speicherbandbreite von 800 GB/s, geteilt durch 3,82 GB Modellgewichte, liegt bei etwa 209 Tokens pro Sekunde; die Karte erreicht unter Vulkan nur 59 % davon. Das ist der niedrigste Wirkungsgrad unter den AMD-Karten dieser Messreihe (83 % bei einer RX 6700 XT, 77 % bei einer RX 7900 GRE, 72 % bei einer RX 7800 XT). Die wahrscheinliche Erklärung ist, dass ein Modell mit 7 Milliarden Parametern zu klein ist, um die Speicherbandbreite eines großen Chips voll auszuschöpfen; bei größeren Modellen lässt sich auf einen besseren Wirkungsgrad hoffen, doch keine Messung aus diesen Reihen belegt das, und es wäre unvorsichtig, Durchsatzwerte für ein 24B-Modell anzugeben.

RX 7900 XT mit Llama 2 7B Q4_0 (öffentliche llama.cpp-Messungen)
BackendFlash AttentionLeseleistung pp512Generierung tg128
Vulkannein2 941,58 t/s123,18 t/s
Vulkanja2 701,13 t/s120,62 t/s
ROCmnein3 098,38 t/s116,15 t/s

Um die Größenordnung bei großen Modellen abzuschätzen, lässt sich ein vorsichtiger Richtwert berechnen, indem man den gemessenen Wirkungsgrad von 59 % auf die theoretische Obergrenze anwendet: Bei einem 24B-Modell in Q4 mit 14 GB ergibt 800 geteilt durch 14 eine Obergrenze von etwa 57 Tokens pro Sekunde und damit ungefähr 34 Tokens pro Sekunde. Das ist eine Berechnung, keine Messung; wenn der Wirkungsgrad bei einem großen Modell besser ist, liegt der tatsächliche Durchsatz höher.

#Im Vergleich zur RX 7900 XTX: Der tatsächliche Unterschied ist viel größer, als gemeinhin behauptet wird

Man liest oft, dass die 7900 XT „10 bis 12 % langsamer“ sei als die 7900 XTX. Die öffentlich verfügbaren Messungen zeigen jedoch etwas anderes. Beim 7B-Referenzmodell unter Vulkan generiert die XTX 182,63 Tokens pro Sekunde, gegenüber 123,18 bei der XT: 48 % mehr. Das Verhältnis der Stream-Prozessoren (6.144 gegenüber 5.376) allein erklärt diesen Unterschied nicht; die Speicherbandbreite und der Chip vergrößern den Abstand. Der Vorteil der XT bleibt der Einstiegspreis: Mit 20 GB deckt sie die wesentlichen Anforderungen von Modellen mit 24 bis 26 Milliarden Parametern ab.

RX 7900 XT und RX 7900 XTX (Llama 2 7B Q4_0, öffentliche Messungen)
MessungRX 7900 XTRX 7900 XTX
VRAM20 GB24 GB
Vulkan, Generation tg128123,18 t/s182,63 t/s
Vulkan, Prompt-Verarbeitung pp5122 941,58 t/s3 726,99 t/s

Diese Korrektur verändert die Abwägung: Wenn Ihnen die Generierungsgeschwindigkeit wichtig ist, wiegt der Unterschied von 48 % schwerer als die zusätzlichen 4 GB VRAM. Wenn Sie dagegen vor allem Kapazität für den Kontext benötigen, bietet die XT bei einem 24B-Modell das Wesentliche dessen, was die XTX bietet. Bei einem Modell mit 30B oder mehr beseitigen die 24 GB der XTX hingegen die Kompromisse beim Kontext, und genau dann ist ihr Preisunterschied gerechtfertigt.

#Im Vergleich zur RTX 4070 Ti Super: mehr Speicher, weniger Geschwindigkeit

Die RTX 4070 Ti Super bietet 16 GB, also 4 GB weniger. Beim 7B-Referenzmodell unter Vulkan generiert sie 129,45 Tokens pro Sekunde, also 5 % mehr als die RX 7900 XT, und verarbeitet den Prompt mit 6.099 Tokens pro Sekunde, also doppelt so schnell. Die XT ist somit nicht „schneller“, wie man gelegentlich liest: Sie hat mehr Speicher. Ihr Vorteil ist die Speicherkapazität, die Modelle mit 24 bis 26 Milliarden Parametern samt Kontext ermöglicht.

RX 7900 XT und RTX 4070 Ti Super unter Vulkan (Llama 2 7B Q4_0, ohne FA)
KriteriumRX 7900 XTRTX 4070 Ti Super
VRAM20 GB16 GB
Leseleistung pp5122 941,58 t/s6 099,18 t/s
Generierung tg128123,18 t/s129,45 t/s

#Wenn ein Modell die 20 GB überschreitet

Ein zu großes Modell verursacht keinen Fehler: Ollama und llama.cpp legen so viele Schichten wie möglich auf die Grafikkarte und überlassen den Rest dem Prozessor. In llama.cpp legt die Option -ngl die Anzahl der Schichten fest, die auf die GPU ausgelagert werden, und der in den obigen Messungen verwendete Wert 100 bedeutet „alle“. Diesen Wert zu reduzieren gibt VRAM frei, verlangsamt aber die Generierung, da jedes Token dann den Systemspeicher durchlaufen muss, der deutlich langsamer als GDDR6 ist. Die Faustregel: Solange ollama ps 100 % GPU anzeigt, läuft die Generierung schnell; sobald ein Anteil beim Prozessor angezeigt wird, sinkt die Geschwindigkeit stufenweise.

#20 GB, 16 GB oder 24 GB: Wie man entscheidet

Welche Speicherkapazität für welchen Einsatzzweck
Vorgesehener Einsatzzweck16 GB20 GB (RX 7900 XT)24 GB
Chat mit einem Modell mit 8 bis 14 Milliarden ParameternAusreichendUnnötigUnnötig
Code-Assistent 24B, langer KontextKnapp bemessenKomfortabelKomfortabel
MoE mit 26B und mittlerem KontextZu knappAusreichendAusreichend
Modell mit 30 bis 35 Milliarden Parametern und langem KontextUnmöglichKnappErforderlich

Das Prinzip: Bezahlen Sie für die Kapazität, die Ihr größtes Modell benötigt, nicht für die, die Sie vielleicht eines Tages nutzen könnten. Wenn Sie ein 24B-Modell mit Kontext betreiben möchten, sind 20 GB die erste Kapazitätsstufe, ab der das komfortabel möglich ist; darüber hinaus muss jedes zusätzliche Gigabyte durch ein konkretes Modell gerechtfertigt sein.

#Erste Schritte

  1. 01
    Das System wählen
    AMD unterstützt die Radeon RX 7000 nur unter Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 und RHEL 9.7. Unter Windows verwendet Ollama einen ROCm-v7- oder HIP7-Stack; Vulkan dient als Ausweichlösung.
  2. 02
    Treiber und Ollama installieren
    Unter Linux benötigt Ollama den ROCm-Treiber v7. Installieren Sie ihn mit dem Dienstprogramm amdgpu-install und anschließend Ollama.
  3. 03
    Ein 24B-Modell laden
    Nehmen Sie einen Devstral Small 2 24B in Q4_K_M, starten Sie ihn und überprüfen Sie mit ollama ps, ob er den GPU auf 100 % auslastet.
  4. 04
    Kontext einstellen
    Vergrößern Sie das Kontextfenster schrittweise und überwachen Sie dabei die VRAM-Auslastung: Das Ziel ist es, insgesamt unter 19 GB zu bleiben.
  5. 05
    Vulkan und ROCm vergleichen
    Messen Sie mit llama-bench und Ihrem Modell. Beide Backends liegen bei dieser Karte in den veröffentlichten Messungen nahe beieinander.
Terminal
ollama ps
rocm-smi --showmeminfo vram
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

#Fazit 2026

Eine gute Wahl
Wenn Sie Modelle mit 24 bis 26 Milliarden Parametern samt Kontext ausführen möchten und der Preis pro GB VRAM auf /prix-gpu-ia günstig ist.
Eine mittelmäßige Wahl
Wenn es Ihnen vor allem auf Geschwindigkeit ankommt: Die Generierung erreicht höchstens ein Niveau nahe dem einer Grafikkarte mit 16 GB, und die RTX 4070 Ti Super verarbeitet Prompts doppelt so schnell.
Eine unzureichende Wahl
Für Modelle mit 30 bis 35 Milliarden Parametern und langem Kontext, bei denen 24 GB erforderlich werden.

#Häufig gestellte Fragen

FAQ
Ist die RX 7900 XT gut für lokale LLM geeignet?+
Ja, wegen ihres Speichers: Mit 20 GB lässt sich ein 24B-Modell in Q4 mit ausreichend Spielraum für den Kontext laden, was mit 16 GB kaum möglich ist. Ihre Generierungsgeschwindigkeit liegt mit etwa 123 Tokens pro Sekunde bei einem 7B-Modell in Q4_0 unter Vulkan weiterhin nahe an der einer RX 7800 XT.
RX 7900 XT oder RX 7900 XTX für lokale KI?+
Die XTX bietet 24 GB und eine um 48 % schnellere Generierung beim 7B-Referenzmodell unter Vulkan (182,63 gegenüber 123,18 Tokens pro Sekunde). Die XT reicht für Modelle mit 24 bis 26 Milliarden Parametern und ist günstiger. Vergleichen Sie die aktuellen Preise auf der entsprechenden Seite dieser Website.
Reichen 20 GB VRAM aus, um ein 30B-Modell zu betreiben?+
Ein 30B-Modell wie Granite 4.1 30B ist in Q4 etwa 17 GB groß: Mit einem kurzen Kontext passt es in den VRAM, wobei etwa 2 GB Reserve bleiben. Für einen langen Kontext oder Modelle mit 35B wie Qwen3.6 35B-A3B werden 24 GB benötigt. Lesen Sie den diesem Modell gewidmeten Leitfaden.
Wie viele Tokens pro Sekunde erzeugt eine RX 7900 XT?+
Auf Llama 2 7B in Q4_0 zeigen die öffentlichen Diskussionen im Repository llama.cpp eine Geschwindigkeit von 123,18 Token pro Sekunde unter Vulkan und 116,15 unter ROCm bei der Generierung. Für ein 24B in Q4 ergibt die Berechnung etwa 34 Token pro Sekunde: eine Schätzung, die Sie selbst messen sollten.
RX 7900 XT oder RTX 4070 Ti Super für ein LLM?+
Die XT wegen ihrer Speicherkapazität (20 GB gegenüber 16 GB): Sie kann Modelle mit 24 bis 26 Milliarden Parametern samt Kontext laden. Die RTX 4070 Ti Super generiert mit dem 7B-Referenzmodell 5 % schneller und verarbeitet Prompts doppelt so schnell; hinzu kommt das CUDA-Ökosystem. Die Wahl hängt vom angestrebten Modell ab.
Funktioniert die RX 7900 XT mit Ollama unter Windows?+
Ja: Die Ollama-Dokumentation führt sie unter Windows mit einem ROCm-v7- oder HIP7-Stack und unter Linux mit dem ROCm-v7-Treiber auf. AMD führt sie in ROCm mit dem Ziel gfx1100 unter Ubuntu 24.04.4, 22.04.5, RHEL 10.1 und RHEL 9.7 auf. Vulkan bleibt als Ausweichlösung verfügbar.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.