Mittelstufe 11 Min.Radeon RX 9000

Welcher LLM für die Radeon RX 9070 (16 GB) ?

Direkte Antwort

Die Radeon RX 9070 (RDNA 4, 16 GB GDDR6, 640 GB/s, 220 W) führt Modelle mit 20 bis 24 Milliarden Parametern in Q4 aus und erzeugt laut einer öffentlichen Messung mit Llama 2 7B in Q4_0 unter Vulkan etwa 120 Tokens pro Sekunde. Unter Linux unterstützt Ollama die Karte mit ROCm v7; unter Windows steht sie nicht auf der ROCm-Liste von Ollama und wird über Vulkan betrieben, das bereits gute Ergebnisse liefert.

Die RX 9070 ist die neueste 16-GB-Grafikkarte von AMD in dieser Preisklasse und hat einen deutlich geringeren Stromverbrauch als ihre Vorgänger aus der RX 7000-Serie. Dieser Guide zeigt, was sie ausführt, was aus öffentlichen Messungen über ihre Geschwindigkeit bekannt ist, was sich zwischen Linux und Windows unterscheidet und wo sie sich im Vergleich zur RX 9070 XT und den 16-GB-RTX-Karten einordnet.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Für diese Konfiguration: Radeon RX 9070 XT 16 GB.

Warum diese Wahl? Unsere vollständige Übersicht zu Radeon RX 9070 XT 16 GB →

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#Was die RX 9070 im Jahr 2026 leistet

Die RX 9070 lädt Modelle mit 8 bis 14 Milliarden Parametern in Q4 problemlos und bewältigt auch Modelle mit 20 bis 24 Milliarden Parametern, wobei die größeren einen kurzen Kontext benötigen. Ihr 16 GB großer GDDR6-Speicher mit 20,1 Gb/s an einem 256-Bit-Bus bietet eine Bandbreite von 640 GB/s; damit wird die Angabe der alten Version dieser Seite (644) korrigiert. Für Llama 2 7B in Q4_0 nennt die öffentliche Diskussion im llama.cpp-Repository bei der Generierung 119,71 Tokens pro Sekunde unter Vulkan und 114,48 unter ROCm. Die Prompt-Verarbeitung erreicht unter Vulkan 3.164 Tokens pro Sekunde und ist damit schneller als bei der RX 7800 XT und der RX 7900 GRE. Ein weiterer Vorteil ist ihre TDP von 220 W, die 40 bis 50 W unter der ihrer Vorgängerinnen mit 16 GB liegt.

Architektur
RDNA 4, Prozessorengene der RX 9000-Serie, mit dem gleichen 256-Bit-Bus wie die 9070 XT
Berechnung
3.584 Streamprozessoren (4.096 bei der 9070 XT).
Speicher
16 GB GDDR6, 20,1 Gb/s, 256-Bit-Bus, 640 GB/s
Verbrauch
TDP von 220 W (304 W für die 9070 XT).
Preis
Nicht angegeben: Der Preis ändert sich jede Woche, siehe /prix-gpu-ia.

#Linux, Windows: ROCm oder Vulkan

Ein Merkmal der RDNA 4-Generation ist die unterschiedliche Unterstützung je nach System. AMD listet die RX 9070 in ROCm (Ziel gfx1201) und die Dokumentation von Ollama nennt sie für Linux mit dem ROCm-Treiber v7. Bei Windows hingegen endet die ROCm-Liste von Ollama bei der RX 7900 XTX; die RX 9070 wird dort nicht aufgeführt. Sie bleibt jedoch über Vulkan nutzbar, der standardmäßig aktiviert ist und dabei gute Durchsatzraten zeigt. AMD betont schließlich, dass die Radeon RX 9000 nur unter Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 und RHEL 9.7 unterstützt werden.

Unterstützung der RX 9070
UmgebungStatusPraktische Konsequenz
Linux (Ubuntu 24.04.4, 22.04.5, RHEL 10.1, 9.7)offizielle ROCm-Unterstützung, Ziel gfx1201Ollama mit ROCm-Treiber v7
WindowsFehlt in der ROCm-Liste von OllamaVulkan verwenden, das standardmäßig aktiviert ist
Vulkan, alle SystemeAllgemeiner AnsatzMit ROCm vergleichbare Durchsätze in öffentlich zugänglichen Messungen
i
Eine Abweichung, die Sie kennen sollten
Die Tabelle der Zielarchitekturen in der Ollama-Dokumentation nennt beispielhaft gfx1200 für die RX 9070 und gfx1201 für die 9070 XT, während die Tabelle von AMD der RX 9070 gfx1201 zuordnet. Verlassen Sie sich auf den Befehl rocminfo auf Ihrem Rechner, nicht auf ein Beispiel aus der Dokumentation.

#Was in 16 GB VRAM passt

Rechnen Sie mit etwa 15 GB für das Modell und seinen KV-Cache, wenn die Grafikkarte nicht den Bildschirm ansteuert. Der QuelLLM-Katalog nennt unten den Speicherbedarf der Modellgewichte in Q4; der Speicherbedarf für den Kontext kommt noch hinzu.

Was auf eine RX 9070 passt (nur Modellgewichte)
ModellModellgrößePuffer für den KontextFazit
Llama 3.1 8B in Q4≈ 6 GB≈ 9 GBSehr komfortabel, sehr langer Kontext
Gemma 4 12B in Q8≈ 13 GB≈ 2 GBPasst, kurzer Kontext
gpt-oss 20B in Q4≈ 13 GB≈ 2 GBPasst in den Speicher, kurzer bis mittlerer Kontext
Devstral Small 2 24B in Q4≈ 14 GB≈ 1 GBPasst gerade noch hinein
Gemma 4 26B-A4B in Q4≈ 16 GBkeineZu knapp

Diese 16 GB bilden die Grenze zwischen einem 24B-Modell, das hineinpasst, und Modellen mit 26 bis 30 Milliarden Parametern, die nicht mehr hineinpassen. An genau dieser Grenze sind Karten mit 16 GB aller Marken gleichwertig: Die nach VRAM-Kapazität gegliederte Seite vergleicht sie. Was die RX 9070 auszeichnet, sind ihre Vorteile über diese Kapazität hinaus: eine schnellere Verarbeitung von Prompts und ein geringerer Stromverbrauch.

#Gemessene Durchsatzraten: Vulkan vor ROCm

Die Zahlen stammen aus öffentlichen Diskussionen im llama.cpp-Repository, in denen durchgehend Llama 2 7B in Q4_0 (3,56 GiB) und llama-bench verwendet werden; es handelt sich nicht um Messungen dieser Website. Auf der RX 9070 erreicht Vulkan 3.164,10 Tokens pro Sekunde bei der Prompt-Verarbeitung und 119,71 bei der Generierung; mit Flash Attention sind es 2.859,98 und 119,51. ROCm erreicht 2.381,77 und 114,48. Bei der Generierung liegen die beiden Backends nahe beieinander, wobei Vulkan leicht vorne liegt; bei der Prompt-Verarbeitung ist der Unterschied deutlicher. Konfigurationen, Treiber und Commits unterscheiden sich zwischen den Messreihen: Verstehen Sie diese Unterschiede als grobe Größenordnungen.

RX 9070 mit Llama 2 7B Q4_0 (öffentlich verfügbare llama.cpp-Messungen)
BackendFlash AttentionLeseleistung pp512Generierung tg128
Vulkannein3 164,10 t/s119,71 t/s
Vulkanja2 859,98 t/s119,51 t/s
ROCmnein2 381,77 t/s114,48 t/s

Die theoretische Obergrenze der Generierungsgeschwindigkeit ergibt sich aus 640 GB/s geteilt durch 3,82 GB, also etwa 167 Tokens pro Sekunde; unter Vulkan erreicht die Karte 71 % davon. Überträgt man diese Effizienz auf größere Modelle, erhält man Größenordnungen. Das sind Berechnungen, keine Messungen, und sie setzen voraus, dass sich ein größeres Modell wie das 7B-Referenzmodell verhält.

Schätzung von 71 % des Grenzwerts von 640 GB/s (Berechnung, nicht Messung)
Modell (Q4)ModellgrößeTheoretisches MaximumGrößenordnung
Llama 3.1 8B≈ 6 GB≈ 107 Tokens/s≈ 76 Tokens/s
Gemma 4 12B≈ 7 GB≈ 91 Tokens/s≈ 65 Tokens/s
Phi-4 14B≈ 9 GB≈ 71 Tokens/s≈ 50 Tokens/s
Devstral Small 2 24B≈ 14 GB≈ 46 tokens/s≈ 32 Tokens/s

#Was RDNA 4 für ein lokales LLM verändert

RDNA 4 bringt dedizierte KI-Hardware mit: Die RX 9070 verfügt laut Datenblatt der Serie über 112 KI-Beschleuniger, gegenüber 128 bei der 9070 XT. Davon könnte man deutlich höhere Generierungsraten als bei RDNA 3 erwarten. Die öffentlich verfügbaren Messungen zeigen das jedoch nicht: 119,71 Tokens pro Sekunde für die RX 9070 unter Vulkan gegenüber 118,27 für die RX 7800 XT in derselben Diskussion. Die Textgenerierung mit einem LLM wird durch die Speicherbandbreite begrenzt, und 640 GB/s liegen nicht weit von den 624 GB/s der 7800 XT entfernt. Die KI-Beschleuniger kommen eher der Prompt-Verarbeitung zugute, bei der die RX 9070 gegenüber der 7800 XT um 57 % zulegt.

Die Konsequenz für Käufer: Bezahlen Sie RDNA 4 nicht wegen der Geschwindigkeit im Chat, sondern wegen der Promptverarbeitung, des geringeren Stromverbrauchs und der längeren Softwareunterstützung: Neuere Karten werden länger unterstützt als ältere. Wenn Sie einen Chat mit einem Modell mit 8 bis 14 Milliarden Parametern nutzen, liefert eine gebrauchte RX 7800 XT eine ähnliche Generierungsleistung.

#Im Vergleich zur RX 9070 XT: der Unterschied ist größer als „10 %“

Die frühere Version dieser Seite gab an, dass die RX 9070 10 bis 12 % langsamer sei als die 9070 XT. Beim 7B-Referenzmodell unter Vulkan generiert die 9070 XT mit 137,11 Tokens pro Sekunde gegenüber 119,71, also 15 % mehr, und liest Prompts mit 5.036 Tokens pro Sekunde gegenüber 3.164 ein, also 59 % mehr. Dabei haben beide Karten laut ihren Datenblättern dieselbe Speicherkapazität von 16 GB und dieselbe Bandbreite. Der Unterschied liegt daher in der Rechenleistung (4.096 Streamprozessoren gegenüber 3.584), die bei der Generierung wenig und beim Einlesen von Prompts stark ins Gewicht fällt.

RX 9070 und RX 9070 XT unter Vulkan (Llama 2 7B Q4_0, ohne FA)
KriteriumRX 9070RX 9070 XT
Stream-Prozessoren3 5844 096
TDP220 W304 W
Leseleistung pp5123 164,10 t/s5 036,04 t/s
Generierung tg128119,71 t/s137,11 t/s

Klar gesagt: Für den Chat verliert die 9070 15 % Geschwindigkeit und verbraucht 84 W weniger, ein vernünftiger Kompromiss. Für RAG und lange Dokumente liest die 9070 XT etwa 1,6-mal schneller.

#Im Vergleich zu RTX-Karten mit 16 GB: Die Prompt-Verarbeitung bleibt der Schwachpunkt

Im Vergleich zu den unter Vulkan gemessenen NVIDIA-Karten mit 16 GB generiert die RX 9070 etwas langsamer: 8 % langsamer als die RTX 4070 Ti Super und 12 % langsamer als die RTX 5070 Ti. Den Prompt verarbeitet sie mit etwa halb so hoher Geschwindigkeit. Die RTX 5070 mit 12 GB, die oft als direkte Konkurrentin genannt wird, kommt in der als Referenz herangezogenen Vulkan-Diskussion nicht vor: Daher gibt es keinen zuverlässigen zahlenbasierten Vergleich mit ihr, sondern nur den Kapazitätsunterschied von 16 GB gegenüber 12 GB.

RX 9070 und RTX mit 16 GB unter Vulkan (Llama 2 7B Q4_0, ohne FA)
KarteLeseleistung pp512Generierung tg128
RX 90703 164,10 t/s119,71 t/s
RTX 4070 Ti Super6 099,18 t/s129,45 t/s
RTX 5070 Ti6 213,63 t/s135,63 t/s

#Erste Schritte

  1. 01
    Das System wählen
    Unter Linux verwenden Sie Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 oder RHEL 9.7, um im Supportbereich von AMD zu bleiben. Unter Windows verlassen Sie sich auf Vulkan.
  2. 02
    Ollama installieren
    Unter Linux installieren Sie den ROCm-Treiber v7 mit amdgpu-install und anschließend Ollama. Unter Windows installieren Sie Ollama: Vulkan ist standardmäßig aktiviert.
  3. 03
    Ein Modell laden
    Wählen Sie zunächst ein 12B- oder 20B-Modell statt eines 24B-Modells und prüfen Sie anschließend mit ollama ps, ob das Modell zu 100 % auf der GPU läuft.
  4. 04
    Die Backends vergleichen
    Führen Sie llama-bench für Ihr Modell zuerst mit Vulkan und dann mit ROCm aus: In den öffentlichen Messungen liegt Vulkan leicht vorne.
Terminal
ollama ps
rocminfo | grep -i gfx
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

Sollte man auf eine nächste Generation warten? Nichts in den zitierten Messungen rechtfertigt es, für die Nutzung von Modellen mit 8 bis 24 Milliarden Parametern zu warten: Die Grenze ist die Speicherkapazität von 16 GB, die nur eine Karte mit 20 bis 24 GB überwinden kann. Wenn Sie bereits wissen, dass Sie Modelle mit 30 Milliarden Parametern oder mehr möchten, lassen Sie diese Karte aus; andernfalls rechtfertigt sich der Kauf einer Karte mit 16 GB durch das, was Sie heute ausführen, nicht durch das, was morgen erscheint.

#Fazit 2026

Eine gute Wahl
Wenn Sie 16 GB auf einer sparsamen Grafikkarte (220 W) möchten und Vulkan unter Windows akzeptieren.
Bevorzugen Sie die 9070 XT
Wenn Ihre Prompts lang sind: Die Lesegeschwindigkeit ist um 59 % schneller, mit einem Stromverbrauch von 84 W mehr.
Bevorzugen Sie eine RTX mit 16 GB
Wenn Sie CUDA oder eine doppelt so schnelle Prompt-Verarbeitung benötigen.

Die Preise ändern sich schnell: Die Preisübersicht der Website erfasst jeden Montag und Donnerstag den niedrigsten Preis der Grafikkarten für lokale KI sowie den Preis pro GB VRAM. Dieser letzte Wert sollte für den Vergleich mit der RTX 5070 oder der RX 9070 XT maßgeblich sein.

#Häufig gestellte Fragen

FAQ
RX 9070 oder RX 9070 XT für einen lokalen LLM?+
Die 9070 XT generiert beim 7B-Referenzmodell unter Vulkan 15 % schneller und verarbeitet Prompts 59 % schneller, allerdings mit einer TDP von 304 W gegenüber 220 W. Für Chats reicht die 9070 aus; für RAG und lange Dokumente ist die XT gerechtfertigt. Vergleichen Sie die aktuellen Preise.
RX 9070 oder RTX 5070 für einen lokalen LLM?+
Die RX 9070 bietet 16 GB gegenüber 12 GB und ermöglicht damit den Einsatz von Modellen mit 20 bis 24 Milliarden Parametern. Die RTX 5070 bietet weiterhin das CUDA-Ökosystem und eine schnellere Prompt-Verarbeitung. Es wurden keine öffentlich verfügbaren Vulkan-Messwerte für die RTX 5070 gefunden: Der zahlenbasierte Vergleich steht daher noch aus.
Wird die RX 9070 von Ollama unterstützt?+
Unter Linux ja, mit dem ROCm-v7-Treiber: Die Karte steht auf der Liste von Ollama. Unter Windows steht sie nicht auf der ROCm-Liste von Ollama, die bei der RX 7900 XTX endet. Vulkan ist jedoch standardmäßig aktiviert und ermöglicht ihre Nutzung. Prüfen Sie mit ollama ps, ob das Modell auf der GPU geladen ist.
Wie viele Tokens pro Sekunde kann eine RX 9070 erzeugen?+
Für Llama 2 7B in Q4_0 werden in den öffentlichen Diskussionen im llama.cpp-Repository bei der Generierung 119,71 Tokens pro Sekunde unter Vulkan und 114,48 unter ROCm angegeben. Für ein 24B-Modell in Q4 ergibt die Berechnung etwa 32 Tokens pro Sekunde: eine Schätzung, die Sie bei sich vor Ort durch Messungen überprüfen sollten.
Welche Modelle können auf einer RX 9070 mit 16 GB laufen?+
Llama 3.1 8B, Gemma 4 12B bis Q8, gpt-oss 20B und Devstral Small 2 24B in Q4, die beiden Letztgenannten mit kurzem Kontext. Ein Modell mit 26 bis 30B in Q4 überschreitet die 16 GB VRAM und wird teilweise auf dem Prozessor ausgeführt, was die Geschwindigkeit deutlich verringert.
Vulkan oder ROCm auf RX 9070?+
In den öffentlich zugänglichen Messungen im llama.cpp-Repository generiert Vulkan etwas schneller (119,71 gegenüber 114,48 Tokens pro Sekunde) und verarbeitet den Prompt schneller (3.164 gegenüber 2.382). Unter Windows ist Vulkan ohnehin der Standard. Testen Sie beide Varianten mit Ihrem Modell, bevor Sie sich entscheiden.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.