Welcher LLM für die Radeon RX 9070 (16 GB) ?
Die Radeon RX 9070 (RDNA 4, 16 GB GDDR6, 640 GB/s, 220 W) führt Modelle mit 20 bis 24 Milliarden Parametern in Q4 aus und erzeugt laut einer öffentlichen Messung mit Llama 2 7B in Q4_0 unter Vulkan etwa 120 Tokens pro Sekunde. Unter Linux unterstützt Ollama die Karte mit ROCm v7; unter Windows steht sie nicht auf der ROCm-Liste von Ollama und wird über Vulkan betrieben, das bereits gute Ergebnisse liefert.
Die RX 9070 ist die neueste 16-GB-Grafikkarte von AMD in dieser Preisklasse und hat einen deutlich geringeren Stromverbrauch als ihre Vorgänger aus der RX 7000-Serie. Dieser Guide zeigt, was sie ausführt, was aus öffentlichen Messungen über ihre Geschwindigkeit bekannt ist, was sich zwischen Linux und Windows unterscheidet und wo sie sich im Vergleich zur RX 9070 XT und den 16-GB-RTX-Karten einordnet.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Für diese Konfiguration: Radeon RX 9070 XT 16 GB.
Warum diese Wahl? Unsere vollständige Übersicht zu Radeon RX 9070 XT 16 GB →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#Was die RX 9070 im Jahr 2026 leistet
Die RX 9070 lädt Modelle mit 8 bis 14 Milliarden Parametern in Q4 problemlos und bewältigt auch Modelle mit 20 bis 24 Milliarden Parametern, wobei die größeren einen kurzen Kontext benötigen. Ihr 16 GB großer GDDR6-Speicher mit 20,1 Gb/s an einem 256-Bit-Bus bietet eine Bandbreite von 640 GB/s; damit wird die Angabe der alten Version dieser Seite (644) korrigiert. Für Llama 2 7B in Q4_0 nennt die öffentliche Diskussion im llama.cpp-Repository bei der Generierung 119,71 Tokens pro Sekunde unter Vulkan und 114,48 unter ROCm. Die Prompt-Verarbeitung erreicht unter Vulkan 3.164 Tokens pro Sekunde und ist damit schneller als bei der RX 7800 XT und der RX 7900 GRE. Ein weiterer Vorteil ist ihre TDP von 220 W, die 40 bis 50 W unter der ihrer Vorgängerinnen mit 16 GB liegt.
- Architektur
- RDNA 4, Prozessorengene der RX 9000-Serie, mit dem gleichen 256-Bit-Bus wie die 9070 XT
- Berechnung
- 3.584 Streamprozessoren (4.096 bei der 9070 XT).
- Speicher
- 16 GB GDDR6, 20,1 Gb/s, 256-Bit-Bus, 640 GB/s
- Verbrauch
- TDP von 220 W (304 W für die 9070 XT).
- Preis
- Nicht angegeben: Der Preis ändert sich jede Woche, siehe /prix-gpu-ia.
#Linux, Windows: ROCm oder Vulkan
Ein Merkmal der RDNA 4-Generation ist die unterschiedliche Unterstützung je nach System. AMD listet die RX 9070 in ROCm (Ziel gfx1201) und die Dokumentation von Ollama nennt sie für Linux mit dem ROCm-Treiber v7. Bei Windows hingegen endet die ROCm-Liste von Ollama bei der RX 7900 XTX; die RX 9070 wird dort nicht aufgeführt. Sie bleibt jedoch über Vulkan nutzbar, der standardmäßig aktiviert ist und dabei gute Durchsatzraten zeigt. AMD betont schließlich, dass die Radeon RX 9000 nur unter Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 und RHEL 9.7 unterstützt werden.
| Umgebung | Status | Praktische Konsequenz |
|---|---|---|
| Linux (Ubuntu 24.04.4, 22.04.5, RHEL 10.1, 9.7) | offizielle ROCm-Unterstützung, Ziel gfx1201 | Ollama mit ROCm-Treiber v7 |
| Windows | Fehlt in der ROCm-Liste von Ollama | Vulkan verwenden, das standardmäßig aktiviert ist |
| Vulkan, alle Systeme | Allgemeiner Ansatz | Mit ROCm vergleichbare Durchsätze in öffentlich zugänglichen Messungen |
#Was in 16 GB VRAM passt
Rechnen Sie mit etwa 15 GB für das Modell und seinen KV-Cache, wenn die Grafikkarte nicht den Bildschirm ansteuert. Der QuelLLM-Katalog nennt unten den Speicherbedarf der Modellgewichte in Q4; der Speicherbedarf für den Kontext kommt noch hinzu.
| Modell | Modellgröße | Puffer für den Kontext | Fazit |
|---|---|---|---|
| Llama 3.1 8B in Q4 | ≈ 6 GB | ≈ 9 GB | Sehr komfortabel, sehr langer Kontext |
| Gemma 4 12B in Q8 | ≈ 13 GB | ≈ 2 GB | Passt, kurzer Kontext |
| gpt-oss 20B in Q4 | ≈ 13 GB | ≈ 2 GB | Passt in den Speicher, kurzer bis mittlerer Kontext |
| Devstral Small 2 24B in Q4 | ≈ 14 GB | ≈ 1 GB | Passt gerade noch hinein |
| Gemma 4 26B-A4B in Q4 | ≈ 16 GB | keine | Zu knapp |
Diese 16 GB bilden die Grenze zwischen einem 24B-Modell, das hineinpasst, und Modellen mit 26 bis 30 Milliarden Parametern, die nicht mehr hineinpassen. An genau dieser Grenze sind Karten mit 16 GB aller Marken gleichwertig: Die nach VRAM-Kapazität gegliederte Seite vergleicht sie. Was die RX 9070 auszeichnet, sind ihre Vorteile über diese Kapazität hinaus: eine schnellere Verarbeitung von Prompts und ein geringerer Stromverbrauch.
#Gemessene Durchsatzraten: Vulkan vor ROCm
Die Zahlen stammen aus öffentlichen Diskussionen im llama.cpp-Repository, in denen durchgehend Llama 2 7B in Q4_0 (3,56 GiB) und llama-bench verwendet werden; es handelt sich nicht um Messungen dieser Website. Auf der RX 9070 erreicht Vulkan 3.164,10 Tokens pro Sekunde bei der Prompt-Verarbeitung und 119,71 bei der Generierung; mit Flash Attention sind es 2.859,98 und 119,51. ROCm erreicht 2.381,77 und 114,48. Bei der Generierung liegen die beiden Backends nahe beieinander, wobei Vulkan leicht vorne liegt; bei der Prompt-Verarbeitung ist der Unterschied deutlicher. Konfigurationen, Treiber und Commits unterscheiden sich zwischen den Messreihen: Verstehen Sie diese Unterschiede als grobe Größenordnungen.
| Backend | Flash Attention | Leseleistung pp512 | Generierung tg128 |
|---|---|---|---|
| Vulkan | nein | 3 164,10 t/s | 119,71 t/s |
| Vulkan | ja | 2 859,98 t/s | 119,51 t/s |
| ROCm | nein | 2 381,77 t/s | 114,48 t/s |
Die theoretische Obergrenze der Generierungsgeschwindigkeit ergibt sich aus 640 GB/s geteilt durch 3,82 GB, also etwa 167 Tokens pro Sekunde; unter Vulkan erreicht die Karte 71 % davon. Überträgt man diese Effizienz auf größere Modelle, erhält man Größenordnungen. Das sind Berechnungen, keine Messungen, und sie setzen voraus, dass sich ein größeres Modell wie das 7B-Referenzmodell verhält.
| Modell (Q4) | Modellgröße | Theoretisches Maximum | Größenordnung |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 107 Tokens/s | ≈ 76 Tokens/s |
| Gemma 4 12B | ≈ 7 GB | ≈ 91 Tokens/s | ≈ 65 Tokens/s |
| Phi-4 14B | ≈ 9 GB | ≈ 71 Tokens/s | ≈ 50 Tokens/s |
| Devstral Small 2 24B | ≈ 14 GB | ≈ 46 tokens/s | ≈ 32 Tokens/s |
#Was RDNA 4 für ein lokales LLM verändert
RDNA 4 bringt dedizierte KI-Hardware mit: Die RX 9070 verfügt laut Datenblatt der Serie über 112 KI-Beschleuniger, gegenüber 128 bei der 9070 XT. Davon könnte man deutlich höhere Generierungsraten als bei RDNA 3 erwarten. Die öffentlich verfügbaren Messungen zeigen das jedoch nicht: 119,71 Tokens pro Sekunde für die RX 9070 unter Vulkan gegenüber 118,27 für die RX 7800 XT in derselben Diskussion. Die Textgenerierung mit einem LLM wird durch die Speicherbandbreite begrenzt, und 640 GB/s liegen nicht weit von den 624 GB/s der 7800 XT entfernt. Die KI-Beschleuniger kommen eher der Prompt-Verarbeitung zugute, bei der die RX 9070 gegenüber der 7800 XT um 57 % zulegt.
Die Konsequenz für Käufer: Bezahlen Sie RDNA 4 nicht wegen der Geschwindigkeit im Chat, sondern wegen der Promptverarbeitung, des geringeren Stromverbrauchs und der längeren Softwareunterstützung: Neuere Karten werden länger unterstützt als ältere. Wenn Sie einen Chat mit einem Modell mit 8 bis 14 Milliarden Parametern nutzen, liefert eine gebrauchte RX 7800 XT eine ähnliche Generierungsleistung.
#Im Vergleich zur RX 9070 XT: der Unterschied ist größer als „10 %“
Die frühere Version dieser Seite gab an, dass die RX 9070 10 bis 12 % langsamer sei als die 9070 XT. Beim 7B-Referenzmodell unter Vulkan generiert die 9070 XT mit 137,11 Tokens pro Sekunde gegenüber 119,71, also 15 % mehr, und liest Prompts mit 5.036 Tokens pro Sekunde gegenüber 3.164 ein, also 59 % mehr. Dabei haben beide Karten laut ihren Datenblättern dieselbe Speicherkapazität von 16 GB und dieselbe Bandbreite. Der Unterschied liegt daher in der Rechenleistung (4.096 Streamprozessoren gegenüber 3.584), die bei der Generierung wenig und beim Einlesen von Prompts stark ins Gewicht fällt.
| Kriterium | RX 9070 | RX 9070 XT |
|---|---|---|
| Stream-Prozessoren | 3 584 | 4 096 |
| TDP | 220 W | 304 W |
| Leseleistung pp512 | 3 164,10 t/s | 5 036,04 t/s |
| Generierung tg128 | 119,71 t/s | 137,11 t/s |
Klar gesagt: Für den Chat verliert die 9070 15 % Geschwindigkeit und verbraucht 84 W weniger, ein vernünftiger Kompromiss. Für RAG und lange Dokumente liest die 9070 XT etwa 1,6-mal schneller.
- Radeon RX 9070 XT: 16 GB und mehr Rechenleistung
- Technische Spezifikationen für die Radeon RX 9070 XT
#Im Vergleich zu RTX-Karten mit 16 GB: Die Prompt-Verarbeitung bleibt der Schwachpunkt
Im Vergleich zu den unter Vulkan gemessenen NVIDIA-Karten mit 16 GB generiert die RX 9070 etwas langsamer: 8 % langsamer als die RTX 4070 Ti Super und 12 % langsamer als die RTX 5070 Ti. Den Prompt verarbeitet sie mit etwa halb so hoher Geschwindigkeit. Die RTX 5070 mit 12 GB, die oft als direkte Konkurrentin genannt wird, kommt in der als Referenz herangezogenen Vulkan-Diskussion nicht vor: Daher gibt es keinen zuverlässigen zahlenbasierten Vergleich mit ihr, sondern nur den Kapazitätsunterschied von 16 GB gegenüber 12 GB.
| Karte | Leseleistung pp512 | Generierung tg128 |
|---|---|---|
| RX 9070 | 3 164,10 t/s | 119,71 t/s |
| RTX 4070 Ti Super | 6 099,18 t/s | 129,45 t/s |
| RTX 5070 Ti | 6 213,63 t/s | 135,63 t/s |
#Erste Schritte
- 01Das System wählenUnter Linux verwenden Sie Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 oder RHEL 9.7, um im Supportbereich von AMD zu bleiben. Unter Windows verlassen Sie sich auf Vulkan.
- 02Ollama installierenUnter Linux installieren Sie den ROCm-Treiber v7 mit amdgpu-install und anschließend Ollama. Unter Windows installieren Sie Ollama: Vulkan ist standardmäßig aktiviert.
- 03Ein Modell ladenWählen Sie zunächst ein 12B- oder 20B-Modell statt eines 24B-Modells und prüfen Sie anschließend mit ollama ps, ob das Modell zu 100 % auf der GPU läuft.
- 04Die Backends vergleichenFühren Sie llama-bench für Ihr Modell zuerst mit Vulkan und dann mit ROCm aus: In den öffentlichen Messungen liegt Vulkan leicht vorne.
Sollte man auf eine nächste Generation warten? Nichts in den zitierten Messungen rechtfertigt es, für die Nutzung von Modellen mit 8 bis 24 Milliarden Parametern zu warten: Die Grenze ist die Speicherkapazität von 16 GB, die nur eine Karte mit 20 bis 24 GB überwinden kann. Wenn Sie bereits wissen, dass Sie Modelle mit 30 Milliarden Parametern oder mehr möchten, lassen Sie diese Karte aus; andernfalls rechtfertigt sich der Kauf einer Karte mit 16 GB durch das, was Sie heute ausführen, nicht durch das, was morgen erscheint.
#Fazit 2026
- Eine gute Wahl
- Wenn Sie 16 GB auf einer sparsamen Grafikkarte (220 W) möchten und Vulkan unter Windows akzeptieren.
- Bevorzugen Sie die 9070 XT
- Wenn Ihre Prompts lang sind: Die Lesegeschwindigkeit ist um 59 % schneller, mit einem Stromverbrauch von 84 W mehr.
- Bevorzugen Sie eine RTX mit 16 GB
- Wenn Sie CUDA oder eine doppelt so schnelle Prompt-Verarbeitung benötigen.
Die Preise ändern sich schnell: Die Preisübersicht der Website erfasst jeden Montag und Donnerstag den niedrigsten Preis der Grafikkarten für lokale KI sowie den Preis pro GB VRAM. Dieser letzte Wert sollte für den Vergleich mit der RTX 5070 oder der RX 9070 XT maßgeblich sein.
- Preise für Grafikkarten für lokale KI, zweimal pro Woche aktualisiert
- Ollama-Dokumentation: Unterstützte AMD-Grafikkarten
- ROCm-GPU-Kompatibilität, AMD-Dokumentation
- Vulkan-Scoreboard im llama.cpp-Repository
#Häufig gestellte Fragen
RX 9070 oder RX 9070 XT für einen lokalen LLM?+
RX 9070 oder RTX 5070 für einen lokalen LLM?+
Wird die RX 9070 von Ollama unterstützt?+
Wie viele Tokens pro Sekunde kann eine RX 9070 erzeugen?+
Welche Modelle können auf einer RX 9070 mit 16 GB laufen?+
Vulkan oder ROCm auf RX 9070?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.