Welches LLM auf einer Radeon RX 7900 GRE (16 GB) ?
Die Radeon RX 7900 GRE (16 GB GDDR6, 576 GB/s, 260 W) führt wie die RX 7800 XT Modelle mit 20 bis 24 Milliarden Parametern in Q4 aus, bietet aber keinen Geschwindigkeitsgewinn bei der Generierung: Öffentliche Messungen mit Llama 2 7B ergeben unter Vulkan 116 Tokens pro Sekunde gegenüber 118 bei der 7800 XT. Ihr Vorteil liegt woanders: beim Einlesen des Prompts unter Vulkan, das etwas schneller ist (2.336 gegenüber 2.017 Tokens pro Sekunde).
Die 7900 GRE ähnelt einer 7800 XT mit mehr Rechenleistung, die jedoch beim Speicher ausgebremst wird – und die Messungen zeigen das. Dieser Leitfaden erklärt, was ihre 16 GB ermöglichen, worin sie sich von ihren beiden direkten Nachbarinnen, der RX 7800 XT und der RX 9070, unterscheidet und für welchen Einsatz sie ihren Preis wert ist.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: Radeon RX 9070 XT 16 GB.
Warum diese Wahl? Unsere vollständige Übersicht zu Radeon RX 9070 XT 16 GB →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#Was die RX 7900 GRE im Jahr 2026 leistet
Die RX 7900 GRE lädt in Q4 alles, was weniger als 15 GB belegt: Gemma 4 12B bis hin zu Q8, gpt-oss 20B und Devstral Small 2 24B mit kurzem Kontext. Ihre Generierungsgeschwindigkeit, begrenzt durch ihre Speicherbandbreite von 576 GB/s, liegt beim 7B-Referenzmodell der Scoreboards unter Vulkan bei rund 116 Tokens pro Sekunde. Entscheidend ist: Ihre Anzahl an Streamprozessoren, 5.120 gegenüber 3.840 bei der 7800 XT, beschleunigt die Verarbeitung der Prompts, aber nicht die Generierung, da sie weder mehr Speicher noch mehr Bandbreite als das benachbarte Modell bietet. AMD führt sie offiziell in ROCm auf, und Ollama unterstützt sie unter Linux und Windows.
- Architektur
- RDNA 3, Navi 31 (der Chip der RX 7900 XTX, hier in einer abgespeckten Variante), 80 Recheneinheiten und 5.120 Stream-Prozessoren.
- Speicher
- 16 GB GDDR6 mit einem Bus von 256 Bit, also 576 GB/s.
- Verbrauch
- 260 W Leistungsaufnahme der Grafikkarte.
- Verfügbarkeit
- Zunächst nur in China erhältlich (27. Juli 2023), am 27. Februar 2024 international auf den Markt gebracht, zum Einführungspreis von 549 US-Dollar.
- Aktueller Preis
- Rufen Sie /prix-gpu-ia auf: Der Preis ändert sich jede Woche.
#7900 GRE gegen 7800 XT: Der Speicher entscheidet
Beide Karten bieten 16 GB. Die 7800 XT hat eine Bandbreite von 624 GB/s, die 7900 GRE von 576 GB/s, also 8 % weniger. Bei der Generierung, bei der für jedes Token sämtliche Gewichte erneut gelesen werden, ist die Bandbreite entscheidend: In der Vulkan-Diskussion zu llama.cpp liegt die 7800 XT daher leicht vor der GRE und mit aktiviertem Flash Attention deutlicher. Bei der Prompt-Verarbeitung unter Vulkan gewinnt die GRE wieder die Oberhand (16 % mehr), da hier die Rechenleistung ins Gewicht fällt. Unter ROCm liegt die 7800 XT in beiden öffentlich verfügbaren Messreihen bei beiden Messgrößen vorne.
| Messung | RX 7900 GRE | RX 7800 XT |
|---|---|---|
| Vulkan, Prompt-Verarbeitung pp512, ohne FA | 2 336,31 t/s | 2 017,33 t/s |
| Vulkan, Generierung tg128, ohne FA | 116,11 t/s | 118,27 t/s |
| Vulkan, Generation tg128, mit FA | 110,50 t/s | 124,86 t/s |
| ROCm, Prompt-Verarbeitung pp512, ohne FA | 1 456,98 t/s | 2 151,81 t/s |
| ROCm, Generation tg128, ohne FA | 96,07 t/s | 100,94 t/s |
Diese Messreihen stammen von verschiedenen Mitwirkenden und wurden mit unterschiedlichen Commits von llama.cpp durchgeführt: Die Abweichung gibt eine Größenordnung an, ist aber kein Vergleich unter Laborbedingungen. Dennoch stimmen sie darin überein, dass die GRE nicht schneller generiert als eine 7800 XT. Wenn Sie beide zum gleichen Preis finden, wählen Sie die 7800 XT für Gespräche und die GRE für die Nutzung mit langen Prompts.
#Was in 16 GB VRAM passt
Rechnen Sie mit etwa 15 GB für das Modell und seinen KV-Cache, wenn die Grafikkarte nicht für die Bildschirmausgabe zuständig ist. Die Angaben zu den Modellgewichten in Q4 stammen aus dem QuelLLM-Katalog; der Speicherbedarf für den Kontext kommt hinzu.
| Modell | Modellgröße | Puffer für den Kontext | Fazit |
|---|---|---|---|
| Gemma 4 12B in Q4 | ≈ 7 GB | ≈ 8 GB | Sehr komfortabel, langer Kontext |
| Gemma 4 12B in Q8 | ≈ 13 GB | ≈ 2 GB | Passt, kurzer Kontext |
| gpt-oss 20B in Q4 | ≈ 13 GB | ≈ 2 GB | Passt in den Speicher, kurzer bis mittlerer Kontext |
| Devstral Small 2 24B in Q4 | ≈ 14 GB | ≈ 1 GB | Passt gerade noch hinein |
| Gemma 4 31B in Q4 | ≈ 18 GB | keine | Passt nicht in den Speicher, benötigt 20 bis 24 GB |
Die Grenze bei 16 GB liegt also zwischen dem 24B-Modell, das hineinpasst, und dem 31B-Modell, das nicht hineinpasst. Um diese Grenze zu überschreiten, ohne auf eine Karte mit 24 GB umzusteigen, bietet die RX 7900 XT mit 20 GB zusätzlichen Spielraum als Zwischenlösung; der zugehörige Leitfaden erläutert ihre Vorteile. Für sämtliche Karten mit 16 GB, unabhängig von der Marke, vergleicht die nach VRAM-Kapazität gegliederte Seite die Modelle.
- Radeon RX 7900 XT: 20 GB für Modelle jenseits von 24B
- Welches LLM eignet sich für 16 GB VRAM – unabhängig von der Grafikkarte?
#Gemessene Durchsatzwerte und Bandbreitenobergrenze
Keine der Zahlen auf dieser Seite stammt aus einer Messung dieser Website. Die Werte stammen aus öffentlichen Diskussionen im llama.cpp-Repository, in denen durchweg Llama 2 7B in Q4_0 (3,56 GiB) und llama-bench verwendet werden. Das Einlesen des Prompts (pp512) misst die Geschwindigkeit beim Verarbeiten von 512 Tokens; die Generierung (tg128) misst die Schreibgeschwindigkeit. Für die RX 7900 GRE unter Vulkan nennt die Diskussion bei der Generierung 116,11 Tokens pro Sekunde ohne Flash Attention und 110,50 mit Flash Attention. Unter ROCm nennt sie 96,07.
Die theoretische Obergrenze der Generierung ergibt sich aus der Bandbreite geteilt durch die Größe der Modellgewichte: Hier sind es 576 GB/s geteilt durch 3,82 GB, also etwa 151 Tokens pro Sekunde. Unter Vulkan ohne Flash Attention erreicht die Karte 77 % dieser Obergrenze. Überträgt man diesen Wirkungsgrad auf größere Modelle, erhält man eine grobe Größenordnung: Das ist keine Messung, und ein anderer Treiber oder eine andere Version von llama.cpp wird diesen Wert verändern.
| Modell (Q4) | Modellgröße | Theoretisches Maximum | Größenordnung |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 96 Tokens/s | ≈ 72 Tokens/s |
| Gemma 4 12B | ≈ 7 GB | ≈ 82 Tokens/s | ≈ 62 Tokens/s |
| Phi-4 14B | ≈ 9 GB | ≈ 64 Tokens/s | ≈ 48 Tokens/s |
| Devstral Small 2 24B | ≈ 14 GB | ≈ 41 Tokens/s | ≈ 31 Tokens/s |
#Was das Einlesen des Prompts in der Praxis verändert
Das Einlesen des Prompts wirkt abstrakt, solange man es nicht in Sekunden Wartezeit umrechnet. Die Rechnung ist einfach: Anzahl der Tokens im Prompt geteilt durch die Geschwindigkeit pp512. Sie setzt voraus, dass die bei 512 Tokens gemessene Geschwindigkeit auch bei einem längeren Prompt erhalten bleibt. Das stimmt nur näherungsweise, da das Einlesen mit wachsendem Kontext langsamer wird. Die folgenden Zeiten sind daher grobe Richtwerte für ein Dokument mit etwa 4.000 Tokens, also ungefähr zehn Seiten.
| Karte und Backend | Geschwindigkeit pp512 | Wartezeit vor dem ersten Wort |
|---|---|---|
| RX 7900 GRE, Vulkan | 2 336 t/s | ≈ 1,7 s |
| RX 7800 XT, Vulkan | 2 017 t/s | ≈ 2,0 s |
| RX 7900 GRE, ROCm | 1 457 t/s | ≈ 2,7 s |
| RX 9070, Vulkan | 3 164 t/s | ≈ 1,3 s |
Der Unterschied zwischen diesen Karten liegt bei einem kurzen Dokument also im Bereich von Sekundenbruchteilen. Er wird spürbar, wenn der Prompt Zehntausende von Tokens erreicht, etwa bei einem ganzen Code-Repository oder einem Stapel PDF-Dateien, oder wenn bei jeder Anfrage eines Agenten große Kontexte erneut gelesen werden. Bei geringem Nutzungsvolumen wählen Sie die Karte nach ihren Kosten pro GB VRAM, nicht nach diesem Kriterium.
#Im Vergleich zur RX 9070: gleich viel VRAM, RDNA 4
Die RX 9070 ist die andere Karte mit 16 GB in der aktuellen Produktreihe. Sie bietet 640 GB/s Speicherbandbreite gegenüber 576 GB/s, eine TDP von 220 W gegenüber 260 W und 3.584 Stream-Prozessoren. Unter Vulkan generiert sie 119,71 Tokens pro Sekunde und verarbeitet beim Einlesen 3.164 Tokens pro Sekunde: Beim Einlesen des Prompts ist sie 35 % schneller, bei der Generierung nahezu gleichauf. Der praktische Unterschied liegt an anderer Stelle: ROCm, Ollama und Windows verhalten sich bei diesen beiden Generationen unterschiedlich, wie die Seite zur RX 9070 ausführlich erklärt. Ein konkretes Beispiel: Die Dokumentation von Ollama führt die RX 9070 unter den ROCm-Karten für Linux auf, aber nicht für Windows, wo sie über Vulkan läuft. Die RX 7900 GRE steht dagegen in den Listen beider Systeme. Wenn Sie unter Windows arbeiten und auf ROCm bestehen, spricht das für die GRE; wenn Sie Vulkan akzeptieren, entfällt dieser Unterschied.
| Kriterium | RX 7900 GRE | RX 9070 |
|---|---|---|
| Bandbreite | 576 GB/s | 640 GB/s |
| Kartenleistung | 260 W | 220 W |
| Leseleistung pp512 | 2 336,31 t/s | 3 164,10 t/s |
| Generierung tg128 | 116,11 t/s | 119,71 t/s |
#Erste Schritte
- 01Das System wählenAMD unterstützt die Radeon RX 7000 nur unter Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 und RHEL 9.7. Unter Windows verwendet Ollama einen ROCm-v7- oder HIP7-Stack.
- 02Ollama installierenDer ROCm-v7-Treiber ist unter Linux erforderlich. Vulkan ist standardmäßig aktiviert, dient als Ausweichlösung und liefert auf dieser Karte gute Ergebnisse.
- 03Ein Modell laden, das passtTesten Sie zunächst ein 12B- oder ein 20B-Modell, dann ein 24B-Modell, jeweils mit kurzem Kontext. Prüfen Sie mit ollama ps, ob das Modell vollständig auf der GPU geladen ist.
- 04Die beiden Backends vergleichenStarten Sie llama-bench mit Vulkan und anschließend mit ROCm, mit und ohne Flash Attention. Auf dieser Karte hat die Flash Attention unter Vulkan in den veröffentlichten Messungen die Generierung verlangsamt.
#Für welchen Einsatz eignet sich die 7900 GRE?
Was sie auszeichnet, ist das Verhältnis zwischen Rechenleistung und Speicher: viel Rechenleistung bei 16 GB und 576 GB/s. Sie eignet sich, wenn die Zeit bis zum ersten Wort genauso wichtig ist wie die Schreibgeschwindigkeit, beispielsweise für einen Assistenten, der lange Dokumente verarbeitet, oder einen RAG-Workflow, dessen Prompt Tausende von Tokens umfasst. Bei einem kurzen Chat entfällt der Vorteil, und die 7800 XT mit ihrer höheren Bandbreite schneidet genauso gut oder besser ab.
| Nutzung | Empfohlene Karte | Grund |
|---|---|---|
| Chat, Textgenerierung | RX 7800 XT oder RX 9070 | Höhere Bandbreite, schnellere oder gleichbleibende Generierung |
| RAG, lange Dokumente | RX 9070, dann RX 7900 GRE | Schnellere Verarbeitung des Prompts |
| Modelle mit 30 bis 32 Milliarden Parametern | Keine der drei | Benötigt 20 bis 24 GB VRAM |
| Knappes Budget beim Gebrauchtkauf | Die günstigste der drei | Der Preis pro GB VRAM auf /prix-gpu-ia gibt den Ausschlag |
Zusammengefasst für die drei Karten mit 16 GB: Die 7800 XT ist die unkomplizierte Wahl für Gespräche, die 9070 ist beim Einlesen am schnellsten und mit 220 W am sparsamsten, und die 7900 GRE lohnt sich, wenn ihr Preis unter den der beiden anderen fällt. Keine dieser Karten ermöglicht den Betrieb von Modellen mit 30 Milliarden Parametern, die mehr Speicher benötigen.
#Fazit 2026
- Eine sinnvolle Wahl
- Wenn Sie die GRE zum Preis einer 7800 XT oder günstiger finden und Ihre Prompts lang sind.
- Eine weniger sinnvolle Wahl
- Wenn sie mehr kostet als eine 7800 XT und Sie sie hauptsächlich für Gespräche nutzen: Sie bezahlen für Rechenleistung, die bei der Generierung nicht genutzt wird.
- Vor dem Kauf zu überprüfen
- Dass das System 16 GB VRAM und das richtige Grafikkartenmodell korrekt erkennt – mit rocminfo unter Linux oder dem Task-Manager unter Windows.
- Preise für Grafikkarten für lokale KI, zweimal wöchentlich erfasst
- Ollama-Dokumentation: Unterstützte AMD-Grafikkarten
- ROCm-GPU-Kompatibilität, AMD-Dokumentation
- Vulkan-Scoreboard im llama.cpp-Repository
#Häufig gestellte Fragen
Ist die RX 7900 GRE gut für lokale LLM geeignet?+
RX 7900 GRE oder RX 7800 XT für die lokale KI?+
Welche Modelle können auf einer RX 7900 GRE mit 16 GB laufen?+
Funktioniert die RX 7900 GRE mit Ollama?+
Vulkan oder ROCm für die RX 7900 GRE?+
Wann reicht die RX 7900 GRE nicht mehr aus?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.