Mittelstufe 11 Min.Radeon RX 7000

Welches LLM auf einer Radeon RX 7900 GRE (16 GB) ?

Direkte Antwort

Die Radeon RX 7900 GRE (16 GB GDDR6, 576 GB/s, 260 W) führt wie die RX 7800 XT Modelle mit 20 bis 24 Milliarden Parametern in Q4 aus, bietet aber keinen Geschwindigkeitsgewinn bei der Generierung: Öffentliche Messungen mit Llama 2 7B ergeben unter Vulkan 116 Tokens pro Sekunde gegenüber 118 bei der 7800 XT. Ihr Vorteil liegt woanders: beim Einlesen des Prompts unter Vulkan, das etwas schneller ist (2.336 gegenüber 2.017 Tokens pro Sekunde).

Die 7900 GRE ähnelt einer 7800 XT mit mehr Rechenleistung, die jedoch beim Speicher ausgebremst wird – und die Messungen zeigen das. Dieser Leitfaden erklärt, was ihre 16 GB ermöglichen, worin sie sich von ihren beiden direkten Nachbarinnen, der RX 7800 XT und der RX 9070, unterscheidet und für welchen Einsatz sie ihren Preis wert ist.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Kaufalternative für diesen Guide: Radeon RX 9070 XT 16 GB.

Warum diese Wahl? Unsere vollständige Übersicht zu Radeon RX 9070 XT 16 GB →

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#Was die RX 7900 GRE im Jahr 2026 leistet

Die RX 7900 GRE lädt in Q4 alles, was weniger als 15 GB belegt: Gemma 4 12B bis hin zu Q8, gpt-oss 20B und Devstral Small 2 24B mit kurzem Kontext. Ihre Generierungsgeschwindigkeit, begrenzt durch ihre Speicherbandbreite von 576 GB/s, liegt beim 7B-Referenzmodell der Scoreboards unter Vulkan bei rund 116 Tokens pro Sekunde. Entscheidend ist: Ihre Anzahl an Streamprozessoren, 5.120 gegenüber 3.840 bei der 7800 XT, beschleunigt die Verarbeitung der Prompts, aber nicht die Generierung, da sie weder mehr Speicher noch mehr Bandbreite als das benachbarte Modell bietet. AMD führt sie offiziell in ROCm auf, und Ollama unterstützt sie unter Linux und Windows.

Architektur
RDNA 3, Navi 31 (der Chip der RX 7900 XTX, hier in einer abgespeckten Variante), 80 Recheneinheiten und 5.120 Stream-Prozessoren.
Speicher
16 GB GDDR6 mit einem Bus von 256 Bit, also 576 GB/s.
Verbrauch
260 W Leistungsaufnahme der Grafikkarte.
Verfügbarkeit
Zunächst nur in China erhältlich (27. Juli 2023), am 27. Februar 2024 international auf den Markt gebracht, zum Einführungspreis von 549 US-Dollar.
Aktueller Preis
Rufen Sie /prix-gpu-ia auf: Der Preis ändert sich jede Woche.

#7900 GRE gegen 7800 XT: Der Speicher entscheidet

Beide Karten bieten 16 GB. Die 7800 XT hat eine Bandbreite von 624 GB/s, die 7900 GRE von 576 GB/s, also 8 % weniger. Bei der Generierung, bei der für jedes Token sämtliche Gewichte erneut gelesen werden, ist die Bandbreite entscheidend: In der Vulkan-Diskussion zu llama.cpp liegt die 7800 XT daher leicht vor der GRE und mit aktiviertem Flash Attention deutlicher. Bei der Prompt-Verarbeitung unter Vulkan gewinnt die GRE wieder die Oberhand (16 % mehr), da hier die Rechenleistung ins Gewicht fällt. Unter ROCm liegt die 7800 XT in beiden öffentlich verfügbaren Messreihen bei beiden Messgrößen vorne.

RX 7900 GRE und RX 7800 XT (Llama 2 7B Q4_0, öffentliche Messungen mit llama.cpp)
MessungRX 7900 GRERX 7800 XT
Vulkan, Prompt-Verarbeitung pp512, ohne FA2 336,31 t/s2 017,33 t/s
Vulkan, Generierung tg128, ohne FA116,11 t/s118,27 t/s
Vulkan, Generation tg128, mit FA110,50 t/s124,86 t/s
ROCm, Prompt-Verarbeitung pp512, ohne FA1 456,98 t/s2 151,81 t/s
ROCm, Generation tg128, ohne FA96,07 t/s100,94 t/s

Diese Messreihen stammen von verschiedenen Mitwirkenden und wurden mit unterschiedlichen Commits von llama.cpp durchgeführt: Die Abweichung gibt eine Größenordnung an, ist aber kein Vergleich unter Laborbedingungen. Dennoch stimmen sie darin überein, dass die GRE nicht schneller generiert als eine 7800 XT. Wenn Sie beide zum gleichen Preis finden, wählen Sie die 7800 XT für Gespräche und die GRE für die Nutzung mit langen Prompts.

#Was in 16 GB VRAM passt

Rechnen Sie mit etwa 15 GB für das Modell und seinen KV-Cache, wenn die Grafikkarte nicht für die Bildschirmausgabe zuständig ist. Die Angaben zu den Modellgewichten in Q4 stammen aus dem QuelLLM-Katalog; der Speicherbedarf für den Kontext kommt hinzu.

Was auf eine 7900 GRE passt (nur Modellgewichte)
ModellModellgrößePuffer für den KontextFazit
Gemma 4 12B in Q4≈ 7 GB≈ 8 GBSehr komfortabel, langer Kontext
Gemma 4 12B in Q8≈ 13 GB≈ 2 GBPasst, kurzer Kontext
gpt-oss 20B in Q4≈ 13 GB≈ 2 GBPasst in den Speicher, kurzer bis mittlerer Kontext
Devstral Small 2 24B in Q4≈ 14 GB≈ 1 GBPasst gerade noch hinein
Gemma 4 31B in Q4≈ 18 GBkeinePasst nicht in den Speicher, benötigt 20 bis 24 GB

Die Grenze bei 16 GB liegt also zwischen dem 24B-Modell, das hineinpasst, und dem 31B-Modell, das nicht hineinpasst. Um diese Grenze zu überschreiten, ohne auf eine Karte mit 24 GB umzusteigen, bietet die RX 7900 XT mit 20 GB zusätzlichen Spielraum als Zwischenlösung; der zugehörige Leitfaden erläutert ihre Vorteile. Für sämtliche Karten mit 16 GB, unabhängig von der Marke, vergleicht die nach VRAM-Kapazität gegliederte Seite die Modelle.

#Gemessene Durchsatzwerte und Bandbreitenobergrenze

Keine der Zahlen auf dieser Seite stammt aus einer Messung dieser Website. Die Werte stammen aus öffentlichen Diskussionen im llama.cpp-Repository, in denen durchweg Llama 2 7B in Q4_0 (3,56 GiB) und llama-bench verwendet werden. Das Einlesen des Prompts (pp512) misst die Geschwindigkeit beim Verarbeiten von 512 Tokens; die Generierung (tg128) misst die Schreibgeschwindigkeit. Für die RX 7900 GRE unter Vulkan nennt die Diskussion bei der Generierung 116,11 Tokens pro Sekunde ohne Flash Attention und 110,50 mit Flash Attention. Unter ROCm nennt sie 96,07.

Die theoretische Obergrenze der Generierung ergibt sich aus der Bandbreite geteilt durch die Größe der Modellgewichte: Hier sind es 576 GB/s geteilt durch 3,82 GB, also etwa 151 Tokens pro Sekunde. Unter Vulkan ohne Flash Attention erreicht die Karte 77 % dieser Obergrenze. Überträgt man diesen Wirkungsgrad auf größere Modelle, erhält man eine grobe Größenordnung: Das ist keine Messung, und ein anderer Treiber oder eine andere Version von llama.cpp wird diesen Wert verändern.

Schätzung bei 75 % der Obergrenze von 576 GB/s (Berechnung, keine Messung)
Modell (Q4)ModellgrößeTheoretisches MaximumGrößenordnung
Llama 3.1 8B≈ 6 GB≈ 96 Tokens/s≈ 72 Tokens/s
Gemma 4 12B≈ 7 GB≈ 82 Tokens/s≈ 62 Tokens/s
Phi-4 14B≈ 9 GB≈ 64 Tokens/s≈ 48 Tokens/s
Devstral Small 2 24B≈ 14 GB≈ 41 Tokens/s≈ 31 Tokens/s

#Was das Einlesen des Prompts in der Praxis verändert

Das Einlesen des Prompts wirkt abstrakt, solange man es nicht in Sekunden Wartezeit umrechnet. Die Rechnung ist einfach: Anzahl der Tokens im Prompt geteilt durch die Geschwindigkeit pp512. Sie setzt voraus, dass die bei 512 Tokens gemessene Geschwindigkeit auch bei einem längeren Prompt erhalten bleibt. Das stimmt nur näherungsweise, da das Einlesen mit wachsendem Kontext langsamer wird. Die folgenden Zeiten sind daher grobe Richtwerte für ein Dokument mit etwa 4.000 Tokens, also ungefähr zehn Seiten.

Verarbeitungszeit für einen Prompt mit 4.000 Tokens (aus den pp512-Messungen berechnet)
Karte und BackendGeschwindigkeit pp512Wartezeit vor dem ersten Wort
RX 7900 GRE, Vulkan2 336 t/s≈ 1,7 s
RX 7800 XT, Vulkan2 017 t/s≈ 2,0 s
RX 7900 GRE, ROCm1 457 t/s≈ 2,7 s
RX 9070, Vulkan3 164 t/s≈ 1,3 s

Der Unterschied zwischen diesen Karten liegt bei einem kurzen Dokument also im Bereich von Sekundenbruchteilen. Er wird spürbar, wenn der Prompt Zehntausende von Tokens erreicht, etwa bei einem ganzen Code-Repository oder einem Stapel PDF-Dateien, oder wenn bei jeder Anfrage eines Agenten große Kontexte erneut gelesen werden. Bei geringem Nutzungsvolumen wählen Sie die Karte nach ihren Kosten pro GB VRAM, nicht nach diesem Kriterium.

#Im Vergleich zur RX 9070: gleich viel VRAM, RDNA 4

Die RX 9070 ist die andere Karte mit 16 GB in der aktuellen Produktreihe. Sie bietet 640 GB/s Speicherbandbreite gegenüber 576 GB/s, eine TDP von 220 W gegenüber 260 W und 3.584 Stream-Prozessoren. Unter Vulkan generiert sie 119,71 Tokens pro Sekunde und verarbeitet beim Einlesen 3.164 Tokens pro Sekunde: Beim Einlesen des Prompts ist sie 35 % schneller, bei der Generierung nahezu gleichauf. Der praktische Unterschied liegt an anderer Stelle: ROCm, Ollama und Windows verhalten sich bei diesen beiden Generationen unterschiedlich, wie die Seite zur RX 9070 ausführlich erklärt. Ein konkretes Beispiel: Die Dokumentation von Ollama führt die RX 9070 unter den ROCm-Karten für Linux auf, aber nicht für Windows, wo sie über Vulkan läuft. Die RX 7900 GRE steht dagegen in den Listen beider Systeme. Wenn Sie unter Windows arbeiten und auf ROCm bestehen, spricht das für die GRE; wenn Sie Vulkan akzeptieren, entfällt dieser Unterschied.

RX 7900 GRE und RX 9070 unter Vulkan (Llama 2 7B Q4_0, ohne FA)
KriteriumRX 7900 GRERX 9070
Bandbreite576 GB/s640 GB/s
Kartenleistung260 W220 W
Leseleistung pp5122 336,31 t/s3 164,10 t/s
Generierung tg128116,11 t/s119,71 t/s

#Erste Schritte

  1. 01
    Das System wählen
    AMD unterstützt die Radeon RX 7000 nur unter Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 und RHEL 9.7. Unter Windows verwendet Ollama einen ROCm-v7- oder HIP7-Stack.
  2. 02
    Ollama installieren
    Der ROCm-v7-Treiber ist unter Linux erforderlich. Vulkan ist standardmäßig aktiviert, dient als Ausweichlösung und liefert auf dieser Karte gute Ergebnisse.
  3. 03
    Ein Modell laden, das passt
    Testen Sie zunächst ein 12B- oder ein 20B-Modell, dann ein 24B-Modell, jeweils mit kurzem Kontext. Prüfen Sie mit ollama ps, ob das Modell vollständig auf der GPU geladen ist.
  4. 04
    Die beiden Backends vergleichen
    Starten Sie llama-bench mit Vulkan und anschließend mit ROCm, mit und ohne Flash Attention. Auf dieser Karte hat die Flash Attention unter Vulkan in den veröffentlichten Messungen die Generierung verlangsamt.
Terminal
ollama ps
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

#Für welchen Einsatz eignet sich die 7900 GRE?

Was sie auszeichnet, ist das Verhältnis zwischen Rechenleistung und Speicher: viel Rechenleistung bei 16 GB und 576 GB/s. Sie eignet sich, wenn die Zeit bis zum ersten Wort genauso wichtig ist wie die Schreibgeschwindigkeit, beispielsweise für einen Assistenten, der lange Dokumente verarbeitet, oder einen RAG-Workflow, dessen Prompt Tausende von Tokens umfasst. Bei einem kurzen Chat entfällt der Vorteil, und die 7800 XT mit ihrer höheren Bandbreite schneidet genauso gut oder besser ab.

Welche AMD-Grafikkarte mit 16 GB für welchen Einsatzzweck
NutzungEmpfohlene KarteGrund
Chat, TextgenerierungRX 7800 XT oder RX 9070Höhere Bandbreite, schnellere oder gleichbleibende Generierung
RAG, lange DokumenteRX 9070, dann RX 7900 GRESchnellere Verarbeitung des Prompts
Modelle mit 30 bis 32 Milliarden ParameternKeine der dreiBenötigt 20 bis 24 GB VRAM
Knappes Budget beim GebrauchtkaufDie günstigste der dreiDer Preis pro GB VRAM auf /prix-gpu-ia gibt den Ausschlag

Zusammengefasst für die drei Karten mit 16 GB: Die 7800 XT ist die unkomplizierte Wahl für Gespräche, die 9070 ist beim Einlesen am schnellsten und mit 220 W am sparsamsten, und die 7900 GRE lohnt sich, wenn ihr Preis unter den der beiden anderen fällt. Keine dieser Karten ermöglicht den Betrieb von Modellen mit 30 Milliarden Parametern, die mehr Speicher benötigen.

#Fazit 2026

Eine sinnvolle Wahl
Wenn Sie die GRE zum Preis einer 7800 XT oder günstiger finden und Ihre Prompts lang sind.
Eine weniger sinnvolle Wahl
Wenn sie mehr kostet als eine 7800 XT und Sie sie hauptsächlich für Gespräche nutzen: Sie bezahlen für Rechenleistung, die bei der Generierung nicht genutzt wird.
Vor dem Kauf zu überprüfen
Dass das System 16 GB VRAM und das richtige Grafikkartenmodell korrekt erkennt – mit rocminfo unter Linux oder dem Task-Manager unter Windows.

#Häufig gestellte Fragen

FAQ
Ist die RX 7900 GRE gut für lokale LLM geeignet?+
Ja: Mit ihren 16 GB lassen sich Modelle mit 20 bis 24 Milliarden Parametern in Q4 laden, und laut einer öffentlichen Messung erzeugt sie unter Vulkan mit einem 7B-Modell in Q4_0 etwa 116 Tokens pro Sekunde. Ihr Vorteil gegenüber der RX 7800 XT beschränkt sich auf die Verarbeitung des Prompts.
RX 7900 GRE oder RX 7800 XT für die lokale KI?+
Die 7800 XT für Gespräche: Sie bietet 624 GB/s Bandbreite gegenüber 576 GB/s und generiert in den öffentlichen Messungen etwas schneller. Die 7900 GRE verarbeitet den Prompt unter Vulkan etwa 16 % schneller, was bei langen Dokumenten hilfreich ist. Bei gleichem Preis hängt die Wahl von dieser Nutzung ab.
Welche Modelle können auf einer RX 7900 GRE mit 16 GB laufen?+
Gemma 4 12B in Q4 oder Q8, gpt-oss 20B in Q4 und Devstral Small 2 24B in Q4 passen in den Speicher, bei den letzten beiden mit kurzem Kontext. Ein 31B-Modell wie Gemma 4 in Q4 benötigt etwa 18 GB und überschreitet damit die 16 GB der Karte.
Funktioniert die RX 7900 GRE mit Ollama?+
Ja, die Ollama-Dokumentation führt sie unter Linux mit dem ROCm-Treiber v7 sowie unter Windows auf. AMD führt sie ebenfalls in ROCm mit dem Target gfx1100 auf, allerdings nur unter Ubuntu 24.04.4, 22.04.5, RHEL 10.1 und RHEL 9.7. Vulkan ist in Ollama standardmäßig aktiviert und bleibt als Ausweichlösung nutzbar, falls die Erkennung fehlschlägt.
Vulkan oder ROCm für die RX 7900 GRE?+
In den öffentlichen Diskussionen im llama.cpp-Repository generiert Vulkan auf dieser Karte Tokens schneller als ROCm (116 gegenüber 96 Tokens pro Sekunde ohne Flash Attention) und verarbeitet auch den Prompt schneller. Die Konfigurationen unterscheiden sich von einer Testreihe zur nächsten: Testen Sie beide mit Ihrem Modell.
Wann reicht die RX 7900 GRE nicht mehr aus?+
Sobald Sie Modelle mit 30 Milliarden Parametern oder mehr einsetzen möchten oder bei einem 24B-Modell einen sehr langen Kontext benötigen, reichen 16 GB nicht mehr aus. Die nächsten Schritte sind dann die RX 7900 XT mit 20 GB oder eine Karte mit 24 GB.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.