LLM-Leistung auf einer AMD Radeon 9070XT-GPU

Die Suchanfrage „9070xt llm“ taucht häufig bei Besitzern der Radeon RX 9070 XT auf, die ein Modell lokal ohne NVIDIA-Grafikkarte ausführen möchten. Die gute Nachricht: Mit 16 GB GDDR6 und der ROCm-Unterstützung für die RDNA-4-Architektur ist ein 9070xt-llm-Setup für die meisten persönlichen Anwendungen praktikabel, sofern Sie seine Speichergrenzen verstehen. Diese Seite erläutert die für die Inferenz relevanten Spezifikationen der Karte, den VRAM-Verbrauch je nach Quantisierung (Q4, Q5, Q8, FP16), die zu erwartenden Durchsatzraten in Tokens pro Sekunde, die Modelle aus dem Katalog von quelllm.fr, die sich mit CPU-Offloading nutzen lassen, die Interpretation der Benchmarks sowie die Anwendungsfälle und Tools (llama.cpp, Ollama, vLLM), die tatsächlich auf AMD funktionieren.

Technische Spezifikationen der RX 9070 XT für die Inferenz

Für einen LLM zählt nicht die reine Rechenleistung, sondern die Speicherbandbreite und die Menge an VRAM. Bei diesen beiden Punkten ist die Karte wie folgt einzuordnen:

Zur Einordnung: Die Bandbreite liegt nahe an der einer RX 7900 XT, aber der VRAM bleibt bei 16 GB gegenüber 20 oder 24 GB bei der vorherigen Generation. Diesen Kompromiss sollten Sie vor dem Kauf berücksichtigen. Die Seite der RX 9070 XT listet die Modelle nach Kompatibilität sortiert auf, und der Dedizierter Installationsleitfaden erklärt die Einrichtung Schritt für Schritt.

VRAM: Was je nach Quantisierung in 16 GB passt

Faustregel zur Schätzung des Speicherbedarfs eines dichten Modells: etwa 0,55 bis 0,6 GB pro Milliarde Parameter in Q4, 0,7 in Q5, 1,05 in Q8 und 2 in FP16, zuzüglich des KV-Caches, der mit dem Kontext wächst. Bei 16 GB, wenn 1 bis 1,5 GB für das System und den KV-Cache reserviert werden:

Die Modelle aus dem Referenzkatalog, der auf dieser Seite genannt wird, sind alle deutlich größer. Nehmen wir drei Beispiele aus der Reihe mit 118 bis 128 Milliarden Parametern, bei denen nur aktive Experten an jedem Token arbeiten:

Keines dieser Modelle passt in 16 GB VRAM. Dank der weiter unten erläuterten Auslagerung der Experten in den System-RAM sind sie dennoch für eine 9070 XT interessant.

Durchsatz in Tokens pro Sekunde: geschätzte Größenordnungen

Bei der Generierung wird der Durchsatz eines Modells, das vollständig in den VRAM passt, durch die Bandbreite begrenzt: Für jedes Token müssen alle Gewichte gelesen werden. Bei 640 GB/s liegt die theoretische Grenze für ein 8 GB großes Modell in Q4 bei etwa 80 Tokens pro Sekunde; in der Praxis werden 55 bis 70 % dieses Höchstwerts erreicht. Größenordnungen, sämtlich geschätzt und mit Ihrer eigenen Konfiguration zu bestätigen :

Bei den Mixture-of-Experts-Modellen im Katalog hängt der Durchsatz vor allem vom System-RAM ab. Mit 64 bis 96 GB DDR5 im Dual-Channel-Modus, den Attention-Schichten im VRAM und den Experten im RAM kann man bei einem Modell mit 10 Milliarden aktiven Parametern wie Qwen 3.5 122B-A10B 8 bis 15 Tokens/Sekunde (geschätzt) anpeilen und bei Qwen3.8 Flash Next 125B-A6B 12 bis 20 Tokens/Sekunde (geschätzt). Die Prompt-Verarbeitung bleibt deutlich langsamer als bei einer vollständigen Unterbringung im VRAM. Die Methode ist dokumentiert auf GitHub von llama.cpp über die Optionen zur Platzierung der Tensoren auf der CPU. Der Vergleichstool für lokale Benchmarks liefert auf anderen Grafikkarten gemessene Werte, damit Sie Ihre Erwartungen realistisch einschätzen können.

Expertenmodelle, die mit CPU-Offloading genutzt werden können, und ihre Lizenzen

Für einen ernsthaften Einsatz auf einer 9070 XT mit viel RAM kommen folgende Modelle aus dem Katalog von quelllm.fr mit 118 bis 142 Milliarden Parametern infrage; prüfen Sie die jeweilige Lizenz vor jeder kommerziellen Nutzung:

Apache 2.0 und MIT erlauben den kommerziellen Einsatz ohne besondere Klauseln. Die Lizenzvarianten „Modified MIT“, „NVIDIA Open Model License“ und „OpenMDW“ verfügen über zusätzliche Bedingungen, die vor der Entwicklung eines Produkts im Quellcode des Modells gelesen werden müssen. Wenn Sie zwischen mehreren Kandidaten zögern, dann ist der Vergleichswerkzeug zeigt zwei Einträge nebeneinander an.

Benchmarks: So interpretieren Sie die Ergebnisse für diese GPU

Die veröffentlichten Scores (MMLU für Allgemeinwissen, HumanEval und LiveCodeBench für Code, GPQA für wissenschaftliches Reasoning) messen das Modell bei voller Präzision, nicht Ihre Konfiguration. Bei einer 9070 XT sind drei Vorsichtsmaßnahmen geboten:

Der richtige Ansatz besteht darin, zwei Modelle anhand Ihrer eigenen Aufgaben und mit Ihren eigenen Prompts zu vergleichen, statt sich auf eine aggregierte Rangliste zu verlassen.

Praktische Anwendungsfälle und mit AMD kompatible Tools

Auf der 9070 XT funktionieren tägliche Anwendungen wie der Code-Assistent im Editor, die Zusammenfassung und Umformulierung von Dokumenten, die Übersetzung, die Analyse privater Dateien im lokalen RAG und toolbasierte Agenten bei kurzen Aufgaben gut. Anwendungen mit sehr langem Kontext, wie die Analyse von Verträgen mit mehreren Hunderten Seiten, erfordern entweder ein kleines Modell mit quantifiziertem KV-Cache oder eine zweite Karte.

Seitens der Software:

Falls beim Laden ein Fehler auftritt, kein GPU erkannt wird oder ein stummer Wechsel auf den CPU erfolgt, ist der Troubleshooting-Guide für Ollama GPU Listet häufige Ursachen auf. Wenn Sie eine zweite Karte hinzufügen möchten, um mehr als 16 GB zu erreichen, ist Multi-GPU-Leitfaden für llama.cpp erläutert die Aufteilung der Schichten.

FAQ

F: Ist die RX 9070 XT eine gute Wahl für ein erstes Setup mit einem lokalen LLM?

Ja, für Modelle mit bis zu 24 Milliarden Parametern in Q4, mit komfortablen Durchsatzraten und einem niedrigeren Preis als NVIDIA-Karten mit gleicher VRAM-Kapazität. Der Schwachpunkt bleiben die 16 GB: Vergleichen Sie die Karte mit einer gebrauchten RX 7900 XTX mit 24 GB, wenn Sie größere Modelle einsetzen möchten. Der Leitfaden zur Auswahl einer GPU erläutert diese Abwägungen.

Q: Welche Unterschiede gibt es im Vergleich zur RX 9060 XT 16 GB für LLMs?

Gleiche VRAM-Kapazität, also lassen sich dieselben Modelle laden, aber die 9060 XT verfügt über einen 128-Bit-Bus und eine etwa halb so hohe Bandbreite. Der Durchsatz in Tokens pro Sekunde entspricht ungefähr diesem Verhältnis. Der Benchmark der 9060 XT 16 GB liefert konkrete Messwerte zum Vergleich mit den Schätzungen auf dieser Seite.

F: Kann Qwen 3.5 122B-A10B auf einer 9070 XT laufen?

Nicht allein im VRAM: Die Q4-Version benötigt etwa 73 GB. Mit 96 GB System-RAM oder mehr ermöglicht llama.cpp, die gemeinsam genutzten Schichten auf der GPU zu belassen und die Experten in den RAM auszulagern. Der Durchsatz sinkt dann auf etwa 8 bis 15 Tokens pro Sekunde (geschätzt), was für die Nutzung im Dialog akzeptabel, bei langen Prompts jedoch langsam ist.

Q: ROCm oder Vulkan auf dieser Karte?

ROCm bietet in der Regel 10 bis 25 % mehr Durchsatz (geschätzt) und eine bessere Promptverarbeitung. Vulkan lässt sich ohne spezifische AMD-Abhängigkeiten installieren und funktioniert auf fast allen Linux-Distributionen sowie unter Windows. Beginnen Sie mit Vulkan, um die Hardware zu überprüfen, und wechseln Sie dann zu ROCm, wenn Sie der Zugewinn interessiert und die installierte Version gfx1201 erkennt.

F: Wie viel Systemspeicher sollte zusätzlich bereitgestellt werden?

Wenn Sie sich auf Modelle beschränken, die in den VRAM passen, reichen 32 GB aus. Um die Expertenmodelle aus dem Katalog mit Auslagerung in den Arbeitsspeicher zu nutzen, sollten Sie mindestens 64 GB und idealerweise 96 bis 128 GB DDR5-RAM im Dual-Channel-Betrieb anstreben. Die RAM-Geschwindigkeit beeinflusst in diesem Modus direkt die Tokens pro Sekunde, stärker als der Prozessor selbst.

Q: Welche Modelle laufen ohne GPU, wenn die Grafikkarte belegt ist?

Modelle mit wenigen aktiven Parametern bleiben auch im reinen CPU-Betrieb nutzbar, allerdings mit geringerem Durchsatz. Die Seite zur Inferenz ohne GPU erklärt die Thread- und Quantisierungseinstellungen, die die Leistungseinbußen begrenzen, und die Rangliste nur CPU listet die Kandidaten auf.

Fazit

Ein LLM-Setup mit einer 9070XT ist sinnvoll für alle, die Modelle mit 7 bis 24 Milliarden Parametern schnell lokal ausführen möchten, und bleibt auch für die Expertenmodelle im Katalog nutzbar, sofern in System-RAM investiert wird. Die hier angegebenen Durchsatzwerte sind Schätzungen, die auf Ihrem Rechner bestätigt werden müssen. Um das passende Modell für Ihre 16 GB VRAM, Ihren RAM und Ihren Anwendungsfall zu finden, verwenden Sie den Konfigurator oder durchsuchen Sie den komplettes Katalog filtert nach VRAM.

Das Hardware-Setup für die lokale Ausführung eines LLM

Um diese Modelle komfortabel lokal auszuführen, benötigt man RTX 5070 Ti bietet ein hervorragendes Preis-Leistungs-Verhältnis. Vergleichen Sie die Preise:

Darty RTX 5070 Ti →Amazon RTX 5070 Ti →

Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass Ihnen Mehrkosten entstehen. Als Amazon-Partner verdient QuelLLM an qualifizierten Käufen.

Artikel veröffentlicht und aktualisiert am von Mohamed Meguedmi · Quelle der Daten: /api/models.json · Lizenz für den Inhalt: CC BY 4.0.

Möchten Sie einen Fehler oder eine Aktualisierung melden? Mitwirken.