Welcher LLM auf einer Radeon RX 9060 XT (8 / 16 GB) ?
Die RX 9060 XT lässt sich für lokale LLMs verwenden, sofern Sie die 16-GB-Version wählen: Sie bietet laut AMD dieselbe Speicherbandbreite von 320 GB/s wie die 8-GB-Version, aber genügend Speicher für Modelle mit 12 bis 24 Milliarden Parametern in Q4. Die 8-GB-Version ist auf Modelle mit 9 Milliarden Parametern beschränkt. Die Karte wird unter Linux von ROCm 7 unterstützt.
Die RX 9060 XT ist die Einstiegs-Radeon mit RDNA 4 für lokale KI. Dieser Leitfaden vergleicht ihre beiden Speichervarianten, erklärt, was in den jeweiligen Speicher passt, nennt die durch ihre Bandbreite von 320 GB/s vorgegebene Geschwindigkeitsobergrenze und erläutert ihre Kompatibilität mit Linux und Windows.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: Radeon RX 9070 XT 16 GB.
Warum diese Wahl? Unsere vollständige Übersicht zu Radeon RX 9070 XT 16 GB →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#RX 9060 XT: Die 16-GB-Version ist die einzige ernstzunehmende Option für LLMs
Um LLMs lokal zu betreiben, wählen Sie die Radeon RX 9060 XT in der 16-GB-Version. Beide Versionen verfügen über denselben Grafikprozessor und dieselbe Bandbreite von 320 GB/s; nur die Speicherkapazität unterscheidet sich, und sie entscheidet darüber, was Sie laden können. Mit 8 GB sind Sie auf Modelle mit 7 bis 9 Milliarden Parametern in Q4 mit kurzem Kontext beschränkt. Mit 16 GB können Sie Modelle mit 12 bis 24 Milliarden Parametern, einen längeren Kontext und eine originalgetreuere Quantisierung nutzen. Zum Marktstart gab AMD 299 US-Dollar für die 8-GB-Version und 349 US-Dollar für die 16-GB-Version an: 50 US-Dollar Preisunterschied für doppelt so viel Speicher.
| Eigenschaft | 8 GB | 16 GB |
|---|---|---|
| Speicher | 8 GB GDDR6 | 16 GB GDDR6 |
| Speicherbus und Bandbreite | 128 Bit, bis zu 320 GB/s | 128 Bit, bis zu 320 GB/s |
| Typische Leistungsaufnahme der Karte | 150 W | 160 W |
| Empfohlene Mindestleistung des Netzteils | 450 W | 450 W |
| Empfohlener Preis in den USA zum Start (Mai 2025) | 299 $ | 349 $ |
Die Preise ändern sich; den aktuellen Preis und den Preis pro Gigabyte VRAM finden Sie in der Preisübersicht für Grafikkarten für lokale KI. Merken Sie sich diesen Grundsatz: Bei einer günstigen Karte ist der Aufpreis für die 16-GB-Version gering im Verhältnis zu den Möglichkeiten, die sie eröffnet.
#Kompatibilität mit ROCm, Vulkan und Windows
Die RX 9060 XT ist in der Radeon-Kompatibilitätsmatrix für ROCm 7.2.1 für Ubuntu 22.04, 24.04 und 25.10 aufgeführt. Auch Ollama führt sie unter den von ROCm unter Linux unterstützten Grafikkarten auf, mit dem ROCm-Treiber v7. Unter Linux erfolgt die Installation von Ollama mit ROCm daher genauso wie bei anderen Radeon-Grafikkarten: Der Leitfaden zu Ollama mit AMD-GPU beschreibt die Vorgehensweise im Detail.
Unter Windows sollte Vorsicht walten. Die Liste der Grafikkarten, die die Dokumentation von Ollama für ROCm unter Windows nennt, endet bei den RX 7000 und erwähnt die RX 9000 nicht. Ollama weist außerdem darauf hin, dass Vulkan unter Windows und Linux zusätzliche Unterstützung bietet, die standardmäßig aktiviert ist. Eine RX 9060 XT kann daher unter Windows über Vulkan funktionieren; überprüfen Sie mit ollama ps, ob das Modell tatsächlich auf dem GPU und nicht auf dem Prozessor läuft. LM Studio und llama.cpp bieten ebenfalls einen Vulkan-Backend.
#Was in 8 GB und in 16 GB passt
Die unten aufgeführten Modellgewichte stammen aus dem QuelLLM-Katalog und sind, sofern nicht anders angegeben, in Q4 quantisiert. Hinzu kommen der KV-Cache, der mit der Kontextlänge wächst, und eine Reserve von etwa einem Gigabyte für das System und die Puffer. Ein Modell, dessen Gewichte allein den Speicher der Karte zu 100 % belegen, ist daher zu groß.
| Modell | Modellgröße | 8 GB | 16 GB |
|---|---|---|---|
| Qwen 3.5 9B Q4 | 6 GB | Passt knapp, kurzer Kontext | Komfortabel |
| Qwen 3.5 9B Q8 | 10 GB | Nein | Komfortabel |
| Gemma 4 12B Q4 | 7 GB | Zu eng | Komfortabel |
| Gemma 4 12B Q8 | 13 GB | Nein | Knapp |
| gpt-oss 20B Q4 | 13 GB | Nein | Ja, mit moderater Kontextlänge |
| Mistral Small 24B Q4 | 14 GB | Nein | Knapp, 2 GB für den Kontext |
| Qwen 3.8 27B Q4 | 16 GB | Nein | Nein, überschreitet den verfügbaren VRAM |
Das praktische Fazit lässt sich in einem Satz ausdrücken: Die 16-GB-Variante erschließt die Kategorie mit 12 bis 24 Milliarden Parametern, in der es deutlich leistungsfähigere Modelle für Schlussfolgern, Programmieren und Französisch gibt. Der Leitfaden zu 16 GB VRAM enthält die vollständige Liste, der zu 8 GB die Tipps, um mehr aus dem verfügbaren Speicher herauszuholen.
#Erwartete Geschwindigkeit: Die Bandbreite bestimmt die Grenze
Die Textgenerierung liest bei jedem Token den wesentlichen Teil der Modellgewichte: Die maximale Geschwindigkeit ergibt sich daher aus der Bandbreite geteilt durch die Größe der gelesenen Gewichte. Mit 320 GB/s ergibt sich eine Obergrenze von etwa 53 Tokens pro Sekunde für Qwen 3.5 9B in Q4 (6 GB), 46 für Gemma 4 12B (7 GB), 23 für Mistral Small 24B (14 GB) und etwa 32 für dasselbe Qwen 3.5 9B in Q8 (10 GB). Diese Werte sind theoretische Obergrenzen, die nie exakt erreicht werden; MoE-Modelle, die nur ihre aktiven Gewichte lesen, sind davon teilweise ausgenommen.
Der einzige vergleichbare öffentliche Referenzwert ist die Tabelle der llama.cpp-Community zu ROCm: Für die RX 9060 XT verzeichnet ein Teilnehmer 1 420 Tokens pro Sekunde beim Prompt-Lesen und 68 bei der Generierung auf einem Llama 2 7B in Q4_0, ohne Flash Attention. Dieses kleine Modell ist viel leichter als die in der vorherigen Tabelle. Es gibt die Größenordnung an, nicht die Geschwindigkeit eines 12B oder 24B auf Ihrer Installation, die je nach Treiber, System und Herstellerkarte variieren wird.
| Modell | Pro Token gelesene Gewichte | Theoretisches Maximum |
|---|---|---|
| Qwen 3.5 9B Q4 | 6 GB | ≈ 53 Tokens/s |
| Qwen 3.5 9B Q8 | 10 GB | ≈ 32 Tokens/s |
| Gemma 4 12B Q4 | 7 GB | ≈ 46 tokens/s |
| Mistral Small 24B Q4 | 14 GB | ≈ 23 Token/s |
#Ollama so einstellen, dass die 16 GB nicht überschritten werden
Bei 16 GB zählt für den verbleibenden Spielraum jedes Gigabyte. Drei Einstellungen verhindern, dass unbemerkt Teile der Verarbeitung auf den Prozessor ausgelagert werden, wodurch die Geschwindigkeit ohne Fehlermeldung einbricht. Die erste ist die Kontextgröße: Die Ollama-Dokumentation nennt ein standardmäßiges Kontextfenster von 4.096 Tokens, das sich mit OLLAMA_CONTEXT_LENGTH ändern lässt; jede Verdoppelung des Kontexts vergrößert den KV-Cache. Die zweite ist der KV-Cache selbst, der bei aktivem Flash Attention mit OLLAMA_KV_CACHE_TYPE quantisiert werden kann (standardmäßig f16, q8_0 zur Verkleinerung). Die dritte ist die Kontrolle: Nach einer Antwort zeigt ollama ps die Aufteilung zwischen GPU und Prozessor an.
Ein Beispiel für die Überlegung: Ein 14 GB großes Modell wie Mistral Small 24B in Q4 lässt auf einer Karte mit 16 GB etwa 2 GB für den Kontext, den Cache und die Puffer frei. Wenn ollama ps eine Aufteilung zwischen GPU und CPU anzeigt, reduzieren Sie zuerst den Kontext, quantisieren Sie dann den KV-Cache und wählen Sie anschließend eine niedrigere Quantisierungsstufe, statt Teile des Modells in den Arbeitsspeicher auslagern zu lassen. Der Leitfaden zur KV-Cache-Quantisierung erläutert die Vorgehensweise.
#Kaufen, warten oder 24 GB anstreben
Es gibt drei mögliche Situationen. Wenn Sie bereits einen neueren Desktop-PC und ein Netzteil mit mindestens 450 W haben, ist die 9060 XT mit 16 GB eine einfache Möglichkeit, über die auf kleine Modelle beschränkte Nutzung hinauszugehen und Chat, Übersetzung und kleinere Programmieraufgaben ernsthaft zu nutzen. Wenn Sie Modelle mit 27 bis 35 Milliarden Parametern anstreben, reichen weder die 16 GB noch die 320 GB/s aus: Schauen Sie sich Karten mit 24 GB an, unter anderem im Leitfaden zur RX 7900 XTX. Wenn Sie sich anhand des Preises nicht entscheiden können, vergleichen Sie in der Preisübersicht der Website die Kosten pro Gigabyte VRAM; das ist das richtige Kriterium für lokale KI.
#Zwei RX 9060 XT: 32 GB zu einem günstigeren Preis?
Die Frage taucht immer wieder bei Suchanfragen auf. In llama.cpp verteilt der standardmäßige Aufteilungsmodus die Schichten des Modells im Pipeline-Verfahren auf die Karten; eine Option legt den Anteil pro Karte fest. Zwei 9060 XT mit jeweils 16 GB ergeben insgesamt 32 GB VRAM bei einer laut AMD typischen Leistungsaufnahme von etwa 320 W. Damit lässt sich ein Qwen 3.8 27B in Q4 (16 GB Modellgewichte) mit viel Kontext laden oder ein MoE-Modell mit 30 bis 35 Milliarden Parametern (19 bis 21 GB).
Zwei Einschränkungen sollten Sie kennen. Die Geschwindigkeit pro Token verdoppelt sich nicht: Die Karten arbeiten bei jedem Token nacheinander, und jede behält ihre Bandbreite von 320 GB/s. Außerdem muss das Mainboard zwei nutzbare PCIe-Steckplätze bieten, und das Gehäuse muss belüftet sein. Eine einzelne Karte mit 24 GB, etwa die 7900 XTX, bietet 960 GB/s über einen einzigen Bus; bei einem Modell, das in ihren Speicher passt, generiert sie deutlich schneller.
#FP8: ein Vorteil auf dem Papier, geringe Auswirkungen mit Ollama
Die Radeon RX 9000 gehören zur RDNA-4-Generation, und AMD gibt für die 9060 XT eine FP8-Rechenleistung von 205 TFLOPs an, die im Datenblatt der RX 7900 XTX nicht erwähnt wird. Für den üblichen Einsatz mit Ollama oder LM Studio spielt dieser Punkt kaum eine Rolle: Modelle im GGUF-Format sind auf Ganzzahlen quantisiert (Q4, Q5, Q8), nicht auf FP8. Relevant wird er bei Inferenz-Engines, die FP8-Gewichte nutzen, etwa vLLM, dessen Dokumentation die RX 9000 aufführt. Nutzen Sie dies nicht als Kaufargument, wenn Sie bei Ollama bleiben.
#RX 9060 XT oder RTX 5060 Ti: das Duell mit 16 GB
NVIDIA bietet die RTX 5060 Ti mit 16 GB und mit 8 GB GDDR7-Speicher auf einem 128-Bit-Bus an, während die AMD-Karte GDDR6-Speicher auf einem 128-Bit-Bus nutzt. Der schnellere Speicher verschafft NVIDIA einen Vorteil bei der Speicherbandbreite und damit bei der Generierungsgeschwindigkeit; den genauen Durchsatz finden Sie im NVIDIA-Datenblatt. Der andere Vorteil liegt bei der Software: CUDA ist die Plattform, auf die die meisten KI-Projekte standardmäßig ausgerichtet sind.
| Ihre Priorität | Auswahl | Grund |
|---|---|---|
| Maximale Generationsgeschwindigkeit, CUDA erforderlich | RTX 5060 Ti 16 GB | GDDR7-Speicher, CUDA-Ökosystem |
| Linux, Ollama oder llama.cpp, moderates Budget | RX 9060 XT 16 GB | ROCm 7 und Vulkan decken den allgemeinen Einsatz ab |
| Windows, keine Lust, zu debuggen | RTX 5060 Ti 16 GB | Am universellsten einsetzbare Treiber und Tools |
| Modelle über 16 GB | Keine davon | Ziel: 24 GB – RX 7900 XTX oder RTX 3090 |
| Sehr knappes Budget | RX 9060 XT 8 GB | Nur für Modelle mit 9 Milliarden Parametern verwenden |
- Welcher LLM für 16 GB VRAM: die vollständige Liste
- Welcher LLM für 8 GB VRAM: Tipps und Grenzen
- Ollama mit AMD-GPU (ROCm): Installation Schritt für Schritt
- LLM auf RTX 5060 Ti (8 / 16 GB)
- LLM auf RX 7900 XTX (24 GB)
- Preise für Grafikkarten für lokale KI
- Quelle: AMD-Produktseite zur RX 9060 XT (16 GB)
- Quelle: GPU-Dokumentation von Ollama
- Quelle: Kompatibilität mit ROCm auf Radeon
- Quelle: Leistungs-Tabelle von llama.cpp auf ROCm
#Häufig gestellte Fragen
RX 9060 XT 8 GB oder 16 GB für LLMs?+
Wie viele Tokens pro Sekunde erzeugt eine RX 9060 XT?+
Funktioniert die RX 9060 XT mit Ollama?+
Unterstützt die RX 9060 XT FP8?+
Kann man zwei RX 9060 XT verbinden, um 32 GB zu erhalten?+
Welche Stromversorgung für eine RX 9060 XT?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.