LLM-Leistung auf einer AMD Radeon 9070XT-GPU
Die Suchanfrage „9070xt llm“ taucht häufig bei Besitzern der Radeon RX 9070 XT auf, die ein Modell lokal ohne NVIDIA-Grafikkarte ausführen möchten. Die gute Nachricht: Mit 16 GB GDDR6 und der ROCm-Unterstützung für die RDNA-4-Architektur ist ein 9070xt-llm-Setup für die meisten persönlichen Anwendungen praktikabel, sofern Sie seine Speichergrenzen verstehen. Diese Seite erläutert die für die Inferenz relevanten Spezifikationen der Karte, den VRAM-Verbrauch je nach Quantisierung (Q4, Q5, Q8, FP16), die zu erwartenden Durchsatzraten in Tokens pro Sekunde, die Modelle aus dem Katalog von quelllm.fr, die sich mit CPU-Offloading nutzen lassen, die Interpretation der Benchmarks sowie die Anwendungsfälle und Tools (llama.cpp, Ollama, vLLM), die tatsächlich auf AMD funktionieren.
Technische Spezifikationen der RX 9070 XT für die Inferenz
Für einen LLM zählt nicht die reine Rechenleistung, sondern die Speicherbandbreite und die Menge an VRAM. Bei diesen beiden Punkten ist die Karte wie folgt einzuordnen:
- Architektur : RDNA 4, ROCm-Kennung gfx1201
- VRAM : 16 GB GDDR6, 256-Bit-Bus
- Bandbreite : ca. 640 GB/s (Herstellerangabe)
- Recheneinheiten : 64 CU, 4096 Streamprozessoren
- Typischer Verbrauch : 304 W unter Last
- Software-Unterstützung : ROCm 6.4 und spätere Versionen, das Vulkan-Backend von llama.cpp als Alternative
Zur Einordnung: Die Bandbreite liegt nahe an der einer RX 7900 XT, aber der VRAM bleibt bei 16 GB gegenüber 20 oder 24 GB bei der vorherigen Generation. Diesen Kompromiss sollten Sie vor dem Kauf berücksichtigen. Die Seite der RX 9070 XT listet die Modelle nach Kompatibilität sortiert auf, und der Dedizierter Installationsleitfaden erklärt die Einrichtung Schritt für Schritt.
VRAM: Was je nach Quantisierung in 16 GB passt
Faustregel zur Schätzung des Speicherbedarfs eines dichten Modells: etwa 0,55 bis 0,6 GB pro Milliarde Parameter in Q4, 0,7 in Q5, 1,05 in Q8 und 2 in FP16, zuzüglich des KV-Caches, der mit dem Kontext wächst. Bei 16 GB, wenn 1 bis 1,5 GB für das System und den KV-Cache reserviert werden:
- Q4 (Q4_K_M) : dichte Modelle mit bis zu etwa 20 bis 24 Milliarden Parametern, Kontext 8k bis 16k
- Q5 : bis zu etwa 16 bis 18 Milliarden Parameter
- Q8 : bis zu etwa 12 bis 13 Milliarden Parameter
- FP16 : bis etwa 7 Milliarden Parameter, selten nützlich für lokale Inferenz
Die Modelle aus dem Referenzkatalog, der auf dieser Seite genannt wird, sind alle deutlich größer. Nehmen wir drei Beispiele aus der Reihe mit 118 bis 128 Milliarden Parametern, bei denen nur aktive Experten an jedem Token arbeiten:
- Qwen 3.5 122B-A10B : Q4 ~73 GB, Q5 ~88 GB (geschätzt), Q8 ~130 GB (geschätzt), FP16 ~245 GB (geschätzt). Datenblatt: Qwen 3.5 122B-A10B
- Mistral Small 4 (119B): Q4 ~72 GB, Q8 ~128 GB (geschätzt). Datenblatt: Mistral Small 4
- Qwen3.8 Flash Next 125B-A6B : Q4 ~72 GB, nur 6 Milliarden aktive Parameter. Datenblatt: Qwen3.8 Flash Next
Keines dieser Modelle passt in 16 GB VRAM. Dank der weiter unten erläuterten Auslagerung der Experten in den System-RAM sind sie dennoch für eine 9070 XT interessant.
Durchsatz in Tokens pro Sekunde: geschätzte Größenordnungen
Bei der Generierung wird der Durchsatz eines Modells, das vollständig in den VRAM passt, durch die Bandbreite begrenzt: Für jedes Token müssen alle Gewichte gelesen werden. Bei 640 GB/s liegt die theoretische Grenze für ein 8 GB großes Modell in Q4 bei etwa 80 Tokens pro Sekunde; in der Praxis werden 55 bis 70 % dieses Höchstwerts erreicht. Größenordnungen, sämtlich geschätzt und mit Ihrer eigenen Konfiguration zu bestätigen :
- Dichtes Modell mit 7 bis 9 Milliarden Parametern, Q4, zu 100 % im VRAM : 45 bis 60 Tokens pro Sekunde
- Dichtes Modell mit 12 bis 14 Milliarden Parametern, Q4 : 28 bis 38 Tokens pro Sekunde
- Dichtes Modell mit 22 bis 24 Milliarden Parametern, Q4, kurzer Kontext : 15 bis 22 Tokens pro Sekunde
- Dichtes Modell mit mindestens 30 Milliarden Parametern, Q4 : teilweise Auslagerung auf die CPU, oft 3 bis 6 Tokens/s, im Alltag mühsam
Bei den Mixture-of-Experts-Modellen im Katalog hängt der Durchsatz vor allem vom System-RAM ab. Mit 64 bis 96 GB DDR5 im Dual-Channel-Modus, den Attention-Schichten im VRAM und den Experten im RAM kann man bei einem Modell mit 10 Milliarden aktiven Parametern wie Qwen 3.5 122B-A10B 8 bis 15 Tokens/Sekunde (geschätzt) anpeilen und bei Qwen3.8 Flash Next 125B-A6B 12 bis 20 Tokens/Sekunde (geschätzt). Die Prompt-Verarbeitung bleibt deutlich langsamer als bei einer vollständigen Unterbringung im VRAM. Die Methode ist dokumentiert auf GitHub von llama.cpp über die Optionen zur Platzierung der Tensoren auf der CPU. Der Vergleichstool für lokale Benchmarks liefert auf anderen Grafikkarten gemessene Werte, damit Sie Ihre Erwartungen realistisch einschätzen können.
Expertenmodelle, die mit CPU-Offloading genutzt werden können, und ihre Lizenzen
Für einen ernsthaften Einsatz auf einer 9070 XT mit viel RAM kommen folgende Modelle aus dem Katalog von quelllm.fr mit 118 bis 142 Milliarden Parametern infrage; prüfen Sie die jeweilige Lizenz vor jeder kommerziellen Nutzung:
- Qwen 3.5 122B-A10B (Alibaba): Apache 2.0, Kontext 262k, VRAM Q4 ~73 GB. Gewichtsdaten veröffentlicht auf die Hugging Face-Seite von Alibaba
- Qwen3.8 Flash Next 125B-A6B (Qwen) : Lizenz « andere, open weights », sorgfältig lesen
- Mistral Small 4 (Mistral): Apache 2.0, Kontext 256k. Modellgewichte auf die Hugging Face-Seite von Mistral
- Mistral Medium 3.5 128B : Modified MIT, VRAM Q4 ~74 GB. Datenblatt: Mistral Medium 3.5
- Nemotron 3 Super 120B (NVIDIA): NVIDIA Open Model License, VRAM in Q4 ~72 GB. Modellgewichte auf die Hugging Face-Seite von NVIDIA
- Laguna S 2.1 (Poolside): OpenMDW 1.1, auf Code ausgerichtet, VRAM Q4 ~68 GB, das leichteste Modell der Auswahl
- dots.llm1 Instruct (Rednote) : MIT, VRAM Q4 ~85 GB, Kontext begrenzt auf 32k
- Mixtral 8x22B Instruct (Mistral): Apache 2.0, VRAM in Q4 ~82 GB, ältere Architektur
Apache 2.0 und MIT erlauben den kommerziellen Einsatz ohne besondere Klauseln. Die Lizenzvarianten „Modified MIT“, „NVIDIA Open Model License“ und „OpenMDW“ verfügen über zusätzliche Bedingungen, die vor der Entwicklung eines Produkts im Quellcode des Modells gelesen werden müssen. Wenn Sie zwischen mehreren Kandidaten zögern, dann ist der Vergleichswerkzeug zeigt zwei Einträge nebeneinander an.
Benchmarks: So interpretieren Sie die Ergebnisse für diese GPU
Die veröffentlichten Scores (MMLU für Allgemeinwissen, HumanEval und LiveCodeBench für Code, GPQA für wissenschaftliches Reasoning) messen das Modell bei voller Präzision, nicht Ihre Konfiguration. Bei einer 9070 XT sind drei Vorsichtsmaßnahmen geboten:
- Die Quantisierung verschlechtert die Scores leicht : Bei Q4_K_M bleibt der Verlust bei Modellen mit mehr als 12 Milliarden Parametern im Allgemeinen unter 2 MMLU-Punkten; bei kleineren Modellen fällt er höher aus. Diese Angabe muss für jedes Modell einzeln bestätigt werden.
- Die Benchmark-Ergebnisse im Katalog sind abzugleichen mit demOpen LLM Leaderboard, der die offenen Gewichte unter homogenen Bedingungen bewertet.
- Der gekürzte Kontext verändert die Ergebnisse : Ein Modell, das mit einem Kontext von 256k angekündigt wird, aber mit 8k auf 16 GB VRAM gestartet wird, verhält sich nicht wie in Tests mit langen Kontexten.
Der richtige Ansatz besteht darin, zwei Modelle anhand Ihrer eigenen Aufgaben und mit Ihren eigenen Prompts zu vergleichen, statt sich auf eine aggregierte Rangliste zu verlassen.
Praktische Anwendungsfälle und mit AMD kompatible Tools
Auf der 9070 XT funktionieren tägliche Anwendungen wie der Code-Assistent im Editor, die Zusammenfassung und Umformulierung von Dokumenten, die Übersetzung, die Analyse privater Dateien im lokalen RAG und toolbasierte Agenten bei kurzen Aufgaben gut. Anwendungen mit sehr langem Kontext, wie die Analyse von Verträgen mit mehreren Hunderten Seiten, erfordern entweder ein kleines Modell mit quantifiziertem KV-Cache oder eine zweite Karte.
Seitens der Software:
- Ollama unterstützt ROCm auf RDNA 4 seit den Versionen von 2025; die Anleitung finden Sie im Leitfaden zu Ollama auf AMD-GPUs, und verfolgen lässt sich das Projekt auf GitHub von Ollama
- llama.cpp bietet zwei Backends an: ROCm (HIP) für den höchsten Durchsatz und Vulkan für die einfache Installation, insbesondere dann, wenn ROCm die Karte nicht erkennen kann
- vLLM zielt eher auf den Betrieb für mehrere Nutzer ab; die ROCm-Unterstützung ist dokumentiert auf die vLLM-Website richtet sich aber in erster Linie an professionelle Grafikkarten; vor dem Einsatz testen, bevor Sie sich darauf verlassen
Falls beim Laden ein Fehler auftritt, kein GPU erkannt wird oder ein stummer Wechsel auf den CPU erfolgt, ist der Troubleshooting-Guide für Ollama GPU Listet häufige Ursachen auf. Wenn Sie eine zweite Karte hinzufügen möchten, um mehr als 16 GB zu erreichen, ist Multi-GPU-Leitfaden für llama.cpp erläutert die Aufteilung der Schichten.
FAQ
F: Ist die RX 9070 XT eine gute Wahl für ein erstes Setup mit einem lokalen LLM?
Ja, für Modelle mit bis zu 24 Milliarden Parametern in Q4, mit komfortablen Durchsatzraten und einem niedrigeren Preis als NVIDIA-Karten mit gleicher VRAM-Kapazität. Der Schwachpunkt bleiben die 16 GB: Vergleichen Sie die Karte mit einer gebrauchten RX 7900 XTX mit 24 GB, wenn Sie größere Modelle einsetzen möchten. Der Leitfaden zur Auswahl einer GPU erläutert diese Abwägungen.
Q: Welche Unterschiede gibt es im Vergleich zur RX 9060 XT 16 GB für LLMs?
Gleiche VRAM-Kapazität, also lassen sich dieselben Modelle laden, aber die 9060 XT verfügt über einen 128-Bit-Bus und eine etwa halb so hohe Bandbreite. Der Durchsatz in Tokens pro Sekunde entspricht ungefähr diesem Verhältnis. Der Benchmark der 9060 XT 16 GB liefert konkrete Messwerte zum Vergleich mit den Schätzungen auf dieser Seite.
F: Kann Qwen 3.5 122B-A10B auf einer 9070 XT laufen?
Nicht allein im VRAM: Die Q4-Version benötigt etwa 73 GB. Mit 96 GB System-RAM oder mehr ermöglicht llama.cpp, die gemeinsam genutzten Schichten auf der GPU zu belassen und die Experten in den RAM auszulagern. Der Durchsatz sinkt dann auf etwa 8 bis 15 Tokens pro Sekunde (geschätzt), was für die Nutzung im Dialog akzeptabel, bei langen Prompts jedoch langsam ist.
Q: ROCm oder Vulkan auf dieser Karte?
ROCm bietet in der Regel 10 bis 25 % mehr Durchsatz (geschätzt) und eine bessere Promptverarbeitung. Vulkan lässt sich ohne spezifische AMD-Abhängigkeiten installieren und funktioniert auf fast allen Linux-Distributionen sowie unter Windows. Beginnen Sie mit Vulkan, um die Hardware zu überprüfen, und wechseln Sie dann zu ROCm, wenn Sie der Zugewinn interessiert und die installierte Version gfx1201 erkennt.
F: Wie viel Systemspeicher sollte zusätzlich bereitgestellt werden?
Wenn Sie sich auf Modelle beschränken, die in den VRAM passen, reichen 32 GB aus. Um die Expertenmodelle aus dem Katalog mit Auslagerung in den Arbeitsspeicher zu nutzen, sollten Sie mindestens 64 GB und idealerweise 96 bis 128 GB DDR5-RAM im Dual-Channel-Betrieb anstreben. Die RAM-Geschwindigkeit beeinflusst in diesem Modus direkt die Tokens pro Sekunde, stärker als der Prozessor selbst.
Q: Welche Modelle laufen ohne GPU, wenn die Grafikkarte belegt ist?
Modelle mit wenigen aktiven Parametern bleiben auch im reinen CPU-Betrieb nutzbar, allerdings mit geringerem Durchsatz. Die Seite zur Inferenz ohne GPU erklärt die Thread- und Quantisierungseinstellungen, die die Leistungseinbußen begrenzen, und die Rangliste nur CPU listet die Kandidaten auf.
Fazit
Ein LLM-Setup mit einer 9070XT ist sinnvoll für alle, die Modelle mit 7 bis 24 Milliarden Parametern schnell lokal ausführen möchten, und bleibt auch für die Expertenmodelle im Katalog nutzbar, sofern in System-RAM investiert wird. Die hier angegebenen Durchsatzwerte sind Schätzungen, die auf Ihrem Rechner bestätigt werden müssen. Um das passende Modell für Ihre 16 GB VRAM, Ihren RAM und Ihren Anwendungsfall zu finden, verwenden Sie den Konfigurator oder durchsuchen Sie den komplettes Katalog filtert nach VRAM.
Das Hardware-Setup für die lokale Ausführung eines LLM
Um diese Modelle komfortabel lokal auszuführen, benötigt man RTX 5070 Ti bietet ein hervorragendes Preis-Leistungs-Verhältnis. Vergleichen Sie die Preise:
Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass Ihnen Mehrkosten entstehen. Als Amazon-Partner verdient QuelLLM an qualifizierten Käufen.