Einsteiger 11 Min.Radeon RX 9000

Welcher LLM auf einer Radeon RX 9060 XT (8 / 16 GB) ?

Direkte Antwort

Die RX 9060 XT lässt sich für lokale LLMs verwenden, sofern Sie die 16-GB-Version wählen: Sie bietet laut AMD dieselbe Speicherbandbreite von 320 GB/s wie die 8-GB-Version, aber genügend Speicher für Modelle mit 12 bis 24 Milliarden Parametern in Q4. Die 8-GB-Version ist auf Modelle mit 9 Milliarden Parametern beschränkt. Die Karte wird unter Linux von ROCm 7 unterstützt.

Die RX 9060 XT ist die Einstiegs-Radeon mit RDNA 4 für lokale KI. Dieser Leitfaden vergleicht ihre beiden Speichervarianten, erklärt, was in den jeweiligen Speicher passt, nennt die durch ihre Bandbreite von 320 GB/s vorgegebene Geschwindigkeitsobergrenze und erläutert ihre Kompatibilität mit Linux und Windows.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-29·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Kaufalternative für diesen Guide: Radeon RX 9070 XT 16 GB.

Warum diese Wahl? Unsere vollständige Übersicht zu Radeon RX 9070 XT 16 GB →

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#RX 9060 XT: Die 16-GB-Version ist die einzige ernstzunehmende Option für LLMs

Um LLMs lokal zu betreiben, wählen Sie die Radeon RX 9060 XT in der 16-GB-Version. Beide Versionen verfügen über denselben Grafikprozessor und dieselbe Bandbreite von 320 GB/s; nur die Speicherkapazität unterscheidet sich, und sie entscheidet darüber, was Sie laden können. Mit 8 GB sind Sie auf Modelle mit 7 bis 9 Milliarden Parametern in Q4 mit kurzem Kontext beschränkt. Mit 16 GB können Sie Modelle mit 12 bis 24 Milliarden Parametern, einen längeren Kontext und eine originalgetreuere Quantisierung nutzen. Zum Marktstart gab AMD 299 US-Dollar für die 8-GB-Version und 349 US-Dollar für die 16-GB-Version an: 50 US-Dollar Preisunterschied für doppelt so viel Speicher.

RX 9060 XT mit 8 GB und 16 GB laut AMD
Eigenschaft8 GB16 GB
Speicher8 GB GDDR616 GB GDDR6
Speicherbus und Bandbreite128 Bit, bis zu 320 GB/s128 Bit, bis zu 320 GB/s
Typische Leistungsaufnahme der Karte150 W160 W
Empfohlene Mindestleistung des Netzteils450 W450 W
Empfohlener Preis in den USA zum Start (Mai 2025)299 $349 $

Die Preise ändern sich; den aktuellen Preis und den Preis pro Gigabyte VRAM finden Sie in der Preisübersicht für Grafikkarten für lokale KI. Merken Sie sich diesen Grundsatz: Bei einer günstigen Karte ist der Aufpreis für die 16-GB-Version gering im Verhältnis zu den Möglichkeiten, die sie eröffnet.

#Kompatibilität mit ROCm, Vulkan und Windows

Die RX 9060 XT ist in der Radeon-Kompatibilitätsmatrix für ROCm 7.2.1 für Ubuntu 22.04, 24.04 und 25.10 aufgeführt. Auch Ollama führt sie unter den von ROCm unter Linux unterstützten Grafikkarten auf, mit dem ROCm-Treiber v7. Unter Linux erfolgt die Installation von Ollama mit ROCm daher genauso wie bei anderen Radeon-Grafikkarten: Der Leitfaden zu Ollama mit AMD-GPU beschreibt die Vorgehensweise im Detail.

Unter Windows sollte Vorsicht walten. Die Liste der Grafikkarten, die die Dokumentation von Ollama für ROCm unter Windows nennt, endet bei den RX 7000 und erwähnt die RX 9000 nicht. Ollama weist außerdem darauf hin, dass Vulkan unter Windows und Linux zusätzliche Unterstützung bietet, die standardmäßig aktiviert ist. Eine RX 9060 XT kann daher unter Windows über Vulkan funktionieren; überprüfen Sie mit ollama ps, ob das Modell tatsächlich auf dem GPU und nicht auf dem Prozessor läuft. LM Studio und llama.cpp bieten ebenfalls einen Vulkan-Backend.

i
Ein Punkt, den Sie selbst überprüfen müssen
Die Website testet keine Grafikkarten: Die oben genannte Kompatibilität entspricht den Angaben von AMD und Ollama. Nach der Installation reichen zwei Befehle zur Bestätigung: rocm-smi unter Linux, um die Karte zu sehen, und ollama ps nach einer Antwort, um den prozentualen Anteil abzulesen, der auf der GPU liegt.

#Was in 8 GB und in 16 GB passt

Die unten aufgeführten Modellgewichte stammen aus dem QuelLLM-Katalog und sind, sofern nicht anders angegeben, in Q4 quantisiert. Hinzu kommen der KV-Cache, der mit der Kontextlänge wächst, und eine Reserve von etwa einem Gigabyte für das System und die Puffer. Ein Modell, dessen Gewichte allein den Speicher der Karte zu 100 % belegen, ist daher zu groß.

Modellgrößen (Katalog QuelLLM) und Bewertungen pro Version
ModellModellgröße8 GB16 GB
Qwen 3.5 9B Q46 GBPasst knapp, kurzer KontextKomfortabel
Qwen 3.5 9B Q810 GBNeinKomfortabel
Gemma 4 12B Q47 GBZu engKomfortabel
Gemma 4 12B Q813 GBNeinKnapp
gpt-oss 20B Q413 GBNeinJa, mit moderater Kontextlänge
Mistral Small 24B Q414 GBNeinKnapp, 2 GB für den Kontext
Qwen 3.8 27B Q416 GBNeinNein, überschreitet den verfügbaren VRAM

Das praktische Fazit lässt sich in einem Satz ausdrücken: Die 16-GB-Variante erschließt die Kategorie mit 12 bis 24 Milliarden Parametern, in der es deutlich leistungsfähigere Modelle für Schlussfolgern, Programmieren und Französisch gibt. Der Leitfaden zu 16 GB VRAM enthält die vollständige Liste, der zu 8 GB die Tipps, um mehr aus dem verfügbaren Speicher herauszuholen.

#Erwartete Geschwindigkeit: Die Bandbreite bestimmt die Grenze

Die Textgenerierung liest bei jedem Token den wesentlichen Teil der Modellgewichte: Die maximale Geschwindigkeit ergibt sich daher aus der Bandbreite geteilt durch die Größe der gelesenen Gewichte. Mit 320 GB/s ergibt sich eine Obergrenze von etwa 53 Tokens pro Sekunde für Qwen 3.5 9B in Q4 (6 GB), 46 für Gemma 4 12B (7 GB), 23 für Mistral Small 24B (14 GB) und etwa 32 für dasselbe Qwen 3.5 9B in Q8 (10 GB). Diese Werte sind theoretische Obergrenzen, die nie exakt erreicht werden; MoE-Modelle, die nur ihre aktiven Gewichte lesen, sind davon teilweise ausgenommen.

Der einzige vergleichbare öffentliche Referenzwert ist die Tabelle der llama.cpp-Community zu ROCm: Für die RX 9060 XT verzeichnet ein Teilnehmer 1 420 Tokens pro Sekunde beim Prompt-Lesen und 68 bei der Generierung auf einem Llama 2 7B in Q4_0, ohne Flash Attention. Dieses kleine Modell ist viel leichter als die in der vorherigen Tabelle. Es gibt die Größenordnung an, nicht die Geschwindigkeit eines 12B oder 24B auf Ihrer Installation, die je nach Treiber, System und Herstellerkarte variieren wird.

Theoretische Obergrenze bei 320 GB/s (Bandbreite ÷ Größe der Q4-Modellgewichte aus dem Katalog)
ModellPro Token gelesene GewichteTheoretisches Maximum
Qwen 3.5 9B Q46 GB≈ 53 Tokens/s
Qwen 3.5 9B Q810 GB≈ 32 Tokens/s
Gemma 4 12B Q47 GB≈ 46 tokens/s
Mistral Small 24B Q414 GB≈ 23 Token/s
→
Q8 oder Q4: die tatsächlichen Kosten
Der Wechsel von Q4 zu Q8 verdoppelt nahezu die Menge der bei jedem Token gelesenen Gewichtsdaten und halbiert damit ungefähr die maximal erreichbare Geschwindigkeit. Auf einer Karte mit 320 GB/s bleibt Q4_K_M der beste Kompromiss für den Chat; verwenden Sie Q8 für Aufgaben, bei denen Genauigkeit wichtiger ist als ein flüssiger Ablauf.

#Ollama so einstellen, dass die 16 GB nicht überschritten werden

Bei 16 GB zählt für den verbleibenden Spielraum jedes Gigabyte. Drei Einstellungen verhindern, dass unbemerkt Teile der Verarbeitung auf den Prozessor ausgelagert werden, wodurch die Geschwindigkeit ohne Fehlermeldung einbricht. Die erste ist die Kontextgröße: Die Ollama-Dokumentation nennt ein standardmäßiges Kontextfenster von 4.096 Tokens, das sich mit OLLAMA_CONTEXT_LENGTH ändern lässt; jede Verdoppelung des Kontexts vergrößert den KV-Cache. Die zweite ist der KV-Cache selbst, der bei aktivem Flash Attention mit OLLAMA_KV_CACHE_TYPE quantisiert werden kann (standardmäßig f16, q8_0 zur Verkleinerung). Die dritte ist die Kontrolle: Nach einer Antwort zeigt ollama ps die Aufteilung zwischen GPU und Prozessor an.

Server mit 16k-Kontext und KV-Cache in q8_0
OLLAMA_CONTEXT_LENGTH=16384 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve
# dans un autre terminal
ollama run <nom-du-modèle>
ollama ps

Ein Beispiel für die Überlegung: Ein 14 GB großes Modell wie Mistral Small 24B in Q4 lässt auf einer Karte mit 16 GB etwa 2 GB für den Kontext, den Cache und die Puffer frei. Wenn ollama ps eine Aufteilung zwischen GPU und CPU anzeigt, reduzieren Sie zuerst den Kontext, quantisieren Sie dann den KV-Cache und wählen Sie anschließend eine niedrigere Quantisierungsstufe, statt Teile des Modells in den Arbeitsspeicher auslagern zu lassen. Der Leitfaden zur KV-Cache-Quantisierung erläutert die Vorgehensweise.

#Kaufen, warten oder 24 GB anstreben

Es gibt drei mögliche Situationen. Wenn Sie bereits einen neueren Desktop-PC und ein Netzteil mit mindestens 450 W haben, ist die 9060 XT mit 16 GB eine einfache Möglichkeit, über die auf kleine Modelle beschränkte Nutzung hinauszugehen und Chat, Übersetzung und kleinere Programmieraufgaben ernsthaft zu nutzen. Wenn Sie Modelle mit 27 bis 35 Milliarden Parametern anstreben, reichen weder die 16 GB noch die 320 GB/s aus: Schauen Sie sich Karten mit 24 GB an, unter anderem im Leitfaden zur RX 7900 XTX. Wenn Sie sich anhand des Preises nicht entscheiden können, vergleichen Sie in der Preisübersicht der Website die Kosten pro Gigabyte VRAM; das ist das richtige Kriterium für lokale KI.

#Zwei RX 9060 XT: 32 GB zu einem günstigeren Preis?

Die Frage taucht immer wieder bei Suchanfragen auf. In llama.cpp verteilt der standardmäßige Aufteilungsmodus die Schichten des Modells im Pipeline-Verfahren auf die Karten; eine Option legt den Anteil pro Karte fest. Zwei 9060 XT mit jeweils 16 GB ergeben insgesamt 32 GB VRAM bei einer laut AMD typischen Leistungsaufnahme von etwa 320 W. Damit lässt sich ein Qwen 3.8 27B in Q4 (16 GB Modellgewichte) mit viel Kontext laden oder ein MoE-Modell mit 30 bis 35 Milliarden Parametern (19 bis 21 GB).

Zwei Einschränkungen sollten Sie kennen. Die Geschwindigkeit pro Token verdoppelt sich nicht: Die Karten arbeiten bei jedem Token nacheinander, und jede behält ihre Bandbreite von 320 GB/s. Außerdem muss das Mainboard zwei nutzbare PCIe-Steckplätze bieten, und das Gehäuse muss belüftet sein. Eine einzelne Karte mit 24 GB, etwa die 7900 XTX, bietet 960 GB/s über einen einzigen Bus; bei einem Modell, das in ihren Speicher passt, generiert sie deutlich schneller.

#FP8: ein Vorteil auf dem Papier, geringe Auswirkungen mit Ollama

Die Radeon RX 9000 gehören zur RDNA-4-Generation, und AMD gibt für die 9060 XT eine FP8-Rechenleistung von 205 TFLOPs an, die im Datenblatt der RX 7900 XTX nicht erwähnt wird. Für den üblichen Einsatz mit Ollama oder LM Studio spielt dieser Punkt kaum eine Rolle: Modelle im GGUF-Format sind auf Ganzzahlen quantisiert (Q4, Q5, Q8), nicht auf FP8. Relevant wird er bei Inferenz-Engines, die FP8-Gewichte nutzen, etwa vLLM, dessen Dokumentation die RX 9000 aufführt. Nutzen Sie dies nicht als Kaufargument, wenn Sie bei Ollama bleiben.

#RX 9060 XT oder RTX 5060 Ti: das Duell mit 16 GB

NVIDIA bietet die RTX 5060 Ti mit 16 GB und mit 8 GB GDDR7-Speicher auf einem 128-Bit-Bus an, während die AMD-Karte GDDR6-Speicher auf einem 128-Bit-Bus nutzt. Der schnellere Speicher verschafft NVIDIA einen Vorteil bei der Speicherbandbreite und damit bei der Generierungsgeschwindigkeit; den genauen Durchsatz finden Sie im NVIDIA-Datenblatt. Der andere Vorteil liegt bei der Software: CUDA ist die Plattform, auf die die meisten KI-Projekte standardmäßig ausgerichtet sind.

Entscheidungskriterien bei 16 GB
Ihre PrioritätAuswahlGrund
Maximale Generationsgeschwindigkeit, CUDA erforderlichRTX 5060 Ti 16 GBGDDR7-Speicher, CUDA-Ökosystem
Linux, Ollama oder llama.cpp, moderates BudgetRX 9060 XT 16 GBROCm 7 und Vulkan decken den allgemeinen Einsatz ab
Windows, keine Lust, zu debuggenRTX 5060 Ti 16 GBAm universellsten einsetzbare Treiber und Tools
Modelle über 16 GBKeine davonZiel: 24 GB – RX 7900 XTX oder RTX 3090
Sehr knappes BudgetRX 9060 XT 8 GBNur für Modelle mit 9 Milliarden Parametern verwenden
!
Keine Kaufempfehlung ohne tagesaktuellen Preis
Die Preisdifferenzen zwischen diesen Grafikkarten ändern sich wöchentlich und können die Entscheidung umkehren. Vergleichen Sie sie im Preisverlauf der Website, bevor Sie entscheiden.

#Häufig gestellte Fragen

Häufig gestellte Fragen
RX 9060 XT 8 GB oder 16 GB für LLMs?+
Wählen Sie die 16-GB-Variante. Beide bieten laut AMD eine Bandbreite von 320 GB/s, aber die 8-GB-Variante ist auf Modelle mit 9 Milliarden Parametern in Q4 mit kurzem Kontext beschränkt. Die 16-GB-Variante kann Gemma 4 12B, gpt-oss 20B oder Mistral Small 24B in Q4 laden. Bei der Markteinführung betrug der Unterschied zwischen den empfohlenen Verkaufspreisen 50 Dollar.
Wie viele Tokens pro Sekunde erzeugt eine RX 9060 XT?+
Das hängt vom Modell ab. Die theoretische Obergrenze ergibt sich aus der Bandbreite (320 GB/s) geteilt durch die Modellgewichte: etwa 53 Tokens/s für ein 9B-Modell in Q4 und 23 für ein 24B-Modell. Für Llama 2 7B in Q4_0 berichtet ein Teilnehmer in der llama.cpp-Tabelle von 68 Tokens/s bei der Generierung unter ROCm.
Funktioniert die RX 9060 XT mit Ollama?+
Ja, unter Linux: Ollama führt sie in der Liste der mit ROCm v7 unterstützten Karten auf. Unter Windows endet die ROCm-Liste von Ollama bei den RX 7000, aber das standardmäßig aktivierte Vulkan bietet zusätzliche Unterstützung. Prüfen Sie mit ollama ps, ob das Modell zu 100 % auf der GPU liegt.
Unterstützt die RX 9060 XT FP8?+
Das AMD-Datenblatt nennt 205 TFLOPs für FP8-Matrixberechnungen; diese Angabe fehlt im Datenblatt der RX 7900 XTX. Ollama und GGUF-Modelle in Q4 nutzen diese Leistung nicht direkt. FP8 ist vor allem für vLLM interessant, das die Radeon RX 9000 als unterstützte Hardware aufführt.
Kann man zwei RX 9060 XT verbinden, um 32 GB zu erhalten?+
Ja, mit llama.cpp, das die Schichten standardmäßig auf die GPUs verteilt. Sie erhalten 32 GB Kapazität, aber nicht die doppelte Geschwindigkeit: Jede Karte behält ihre 320 GB/s, und die Karten arbeiten abwechselnd. Rechnen Sie laut AMD mit etwa 320 W für die beiden Karten, zuzüglich des Verbrauchs des restlichen PCs.
Welche Stromversorgung für eine RX 9060 XT?+
AMD empfiehlt für beide Versionen ein Netzteil mit mindestens 450 W; die typische Leistungsaufnahme beträgt 150 W bei der 8-GB-Version und 160 W bei der 16-GB-Version. Addieren Sie den Stromverbrauch des Prozessors und der Laufwerke, um das Netzteil zu dimensionieren, und prüfen Sie anschließend das Datenblatt Ihres genauen Modells, da manche Grafikkartenhersteller mehr als das von AMD angegebene Minimum empfehlen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.