Welcher LLM auf der Radeon RX 6700 XT (12 GB) ?
Die RX 6700 XT (12 GB, 384 GB/s) betreibt problemlos Modelle bis zu 14B in Q4 (etwa 9 GB) sowie ein 12B-Modell wie Gemma 4 12B mit Reserven für den Kontext. Sie nutzt Vulkan statt ROCm: Sie steht weder auf der offiziellen ROCm-Liste noch auf der Liste von Ollama. Bei der Generierung erreicht oder übertrifft sie sogar die Leistung einer RTX 3060 mit 12 GB; bei der Prompt-Verarbeitung ist sie fast doppelt so langsam.
Diese Karte aus dem Jahr 2021 wurde nie für KI konzipiert, doch die Software hat sie trotzdem nicht vergessen. Dieser Leitfaden erklärt, was sie heute ausführen kann, über welchen Softwarepfad, mit welcher Geschwindigkeit laut veröffentlichten Messungen und wann sich ein Austausch mehr lohnt, als hartnäckig an ihr festzuhalten.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: Radeon RX 9070 XT 16 GB.
Warum diese Wahl? Unsere vollständige Übersicht zu Radeon RX 9070 XT 16 GB →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#Was leistet eine RX 6700 XT im Jahr 2026?
Eine Radeon RX 6700 XT eignet sich sehr gut als Einstiegskarte für ein lokales LLM, sofern Sie drei Tatsachen akzeptieren: Ihre 12 GB Speicher reichen für ein Modell mit 14 Milliarden Parametern in Q4 (etwa 9 GB Modellgewichte), aber nicht für ein 24B-Modell; zuverlässig lässt sie sich über Vulkan mit llama.cpp oder Ollama betreiben, da AMD sie nicht in ROCm auflistet; und ihre durch die Bandbreite von 384 GB/s begrenzte Generierungsgeschwindigkeit reicht für eine flüssige Unterhaltung mit einem 8B- bis 12B-Modell aus. Bei einem 7B-Modell in Q4_0 ergibt eine im llama.cpp-Repository veröffentlichte Messung 83,88 Tokens pro Sekunde bei der Generierung unter Vulkan, etwas mehr als die in derselben Diskussion gemessene RTX 3060 mit 12 GB. Der eigentliche Schwachpunkt ist das Einlesen des Prompts, das doppelt so langsam ist.
- Architektur
- RDNA 2, Chip Navi 22, veröffentlicht am 18. März 2021 (Wikipedia-Seite zur RX 6000-Serie)
- Berechnung
- 2.560 Stream-Prozessoren, 40 Recheneinheiten.
- Speicher
- 12 GB GDDR6, Bus 192 Bit, 384 GB/s.
- Verbrauch
- 230 W Kartenleistung.
- Preis
- Hier nicht angegeben: Die Gebrauchtpreise ändern sich jede Woche. Weitere Informationen finden Sie unter /prix-gpu-ia.
#Ollama, ROCm oder Vulkan: der Weg, der funktioniert
Die häufigste Falle bei dieser Karte ist die Suche nach einer ROCm-Anleitung. Die Ollama-Dokumentation listet für Linux Radeon-RX-Modelle von der 6800 bis zur 9070 XT auf: Die 6700 XT ist nicht dabei. Die Kompatibilitätstabelle von AMD nennt für ROCm bei RDNA 2 nur professionelle Karten wie die PRO W6800 oder die V620. Ollama erweitert diese Unterstützung durch Vulkan, das bei installiertem Backend standardmäßig aktiviert ist. Dieser Weg steht auch der 6700 XT offen. Für ROCm gibt es einen Workaround: Die Variable HSA_OVERRIDE_GFX_VERSION erzwingt ein ähnliches LLVM-Ziel, ist aber ausschließlich für Experimente vorgesehen.
| Pfad | Status für diese Karte | Wann diese Wahl sinnvoll ist |
|---|---|---|
| Vulkan (Ollama, llama.cpp, LM Studio) | Funktioniert, öffentlich gemessen unter llama.cpp | Standardauswahl, unter Windows wie unter Linux |
| Offizielles ROCm | Karte fehlt in der ROCm-Liste und in der Liste von Ollama | Zu vermeiden: keine garantierte Unterstützung |
| Erzwungenes ROCm (HSA_OVERRIDE_GFX_VERSION) | Von Ollama dokumentierter Workaround für andere Karten | Nur zum Testen, ohne einen nachgewiesenen Vorteil zu erwarten |
#Was in 12 GB VRAM passt
Die Faustregel dieser Website bleibt dieselbe: Speicherbedarf der Modellgewichte in Q4 plus KV-Cache plus eine Reserve für Treiber und Bildschirmausgabe. Bei 12 GB bleiben mit einem realistischen Speicherbudget etwa 11 GB für das Modell und seinen Kontext, sofern die Karte nicht den Bildschirm ansteuert. Die folgenden Größen stammen aus dem QuelLLM-Katalog und unseren üblichen Richtwerten; sie beziehen sich ausschließlich auf die Modellgewichte.
| Modell | Gewichte in Q4 | Verbleibt für den Kontext | Fazit |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 5 bis 6 GB | Sehr gut nutzbar, langer Kontext möglich |
| Gemma 4 12B | ≈ 7 GB | ≈ 4 bis 5 GB | Gut nutzbar, mittlerer bis langer Kontext |
| Phi-4 14B | ≈ 9 GB | ≈ 2 bis 3 GB | Passt, Kontext begrenzen |
| gpt-oss 20B | ≈ 13 GB | negativ | Passt nicht vollständig in den VRAM: teilweise Auslagerung auf den Prozessor |
| Devstral Small 2 24B | ≈ 14 GB | negativ | Zu groß für 12 GB in Q4 |
Der KV-Cache wächst mit der Länge des Gesprächs. Das erklärt, warum ein 14B-Modell auf dem Papier in den Speicher „passt“, aber sehr langsam wird, sobald der Gesprächsverlauf länger wird. Der VRAM-Rechner der Website gibt den genauen Gesamtbedarf für Ihr Modell und Ihren Kontext an, und der Leitfaden zur Quantisierung des KV-Caches erklärt, wie sich ein oder zwei Gigabyte freigeben lassen. Für alle Karten mit 12 GB vergleicht die entsprechende Seite die Modelle, ohne sich auf AMD zu beschränken.
- VRAM-Rechner für ein Modell und einen gegebenen Kontext
- Welcher LLM für 12 GB VRAM, unabhängig von der Karte
- KV-Cache quantisieren, um VRAM zu sparen
#Gemessene Durchsatzwerte und Bandbreitenobergrenze
Keine der auf dieser Seite genannten Durchsatzangaben wurde von dieser Website selbst gemessen. Die Zahlen stammen aus der öffentlichen Diskussion im llama.cpp-Repository, in der die Karten unter Vulkan mit demselben Modell, Llama 2 7B in Q4_0 (3,56 GiB), und dem Befehl llama-bench verglichen werden. Dabei zählen zwei Werte: pp512, die Lesegeschwindigkeit für einen Prompt mit 512 Tokens, und tg128, die Geschwindigkeit beim Schreiben von 128 Tokens. Für die RX 6700 XT nennt die Diskussion 1.051 Tokens pro Sekunde beim Lesen und 83,88 bei der Generierung; mit aktivierter Flash Attention sind es 1.011 und 81,86.
Dieses Ergebnis lässt sich mit einer einfachen Obergrenze vergleichen: Bei der Generierung muss die Grafikkarte für jedes Token sämtliche Gewichte erneut lesen. Die maximale Geschwindigkeit entspricht daher ungefähr der Bandbreite geteilt durch die Modellgröße. Hier ergeben 384 GB/s bei 3,82 GB an Gewichten eine theoretische Obergrenze von 100 Tokens pro Sekunde; die Karte erreicht 83 % davon. Das ist eine gute Ausnutzung, besser als bei mehreren neueren Karten in derselben Diskussion.
| Modell (Q4) | Modellgröße | Theoretischer Höchstwert 384 GB/s | Realistische Größenordnung (83 %) |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 64 Tokens/s | ≈ 50 bis 55 Tokens pro Sekunde |
| Gemma 4 12B | ≈ 7 GB | ≈ 55 Tokens/s | ≈ 45 Tokens/s |
| Phi-4 14B | ≈ 9 GB | ≈ 43 Tokens/s | ≈ 35 Tokens/s |
Diese Größenordnungen setzen voraus, dass die am 7B-Modell gemessene Effizienz auch bei größeren Modellen erreicht wird, was nicht garantiert ist: Ein Treiber, eine Version von llama.cpp oder eine andere Quantisierung kann das Ergebnis um mehrere Punkte verschieben. Merken Sie sich für die Verarbeitung von Prompts nur das Verhältnis zwischen den Grafikkarten: Die Prompt-Verarbeitung ist es, die bei RAG mit langen Dokumenten ins Gewicht fällt.
#Im Vergleich zur RTX 3060 mit 12 GB: schneller bei der Generierung, langsamer bei der Prompt-Verarbeitung
Beim üblichen Vergleich gilt die RTX 3060 mit 12 GB dank CUDA als überlegen. Die veröffentlichten Messungen unter Vulkan relativieren diese Annahme. Bei der Generierung liegt die RX 6700 XT in beiden Modi vor der RTX 3060; beim Einlesen des Prompts ist die RTX 3060 fast doppelt so leistungsfähig. Beide Messreihen stammen aus derselben Diskussion, wurden aber mit unterschiedlichen Versionen von llama.cpp durchgeführt: Verstehen Sie den Abstand als Anhaltspunkt für die Größenordnung, nicht als endgültige Rangfolge.
| Messung | RX 6700 XT | RTX 3060 (12 GB) |
|---|---|---|
| Prompt-Verarbeitung (pp512), ohne Flash Attention | 1 051,20 t/s | 1 815,70 t/s |
| Generierung (tg128), ohne Flash Attention | 83,88 t/s | 75,94 t/s |
| Prompt-Verarbeitung (pp512) mit Flash Attention | 1 010,90 t/s | 2 012,88 t/s |
| Generierung (tg128) mit Flash Attention | 81,86 t/s | 80,59 t/s |
Die praktische Konsequenz: Für Gespräche mit einem Modell sind beide Karten gleichwertig; bei Fragen zu einem langen Dokument liefert die RTX 3060 das erste Wort schneller. CUDA behält zudem den Vorteil seines Ökosystems, in dem Sie weniger Umgehungslösungen kennen müssen. Bei gleichem Gebrauchtpreis bleibt die RTX 3060 mit 12 GB die vorsichtige Wahl, und die 6700 XT ist nur dann ein gutes Geschäft, wenn sie bereits in Ihrem PC steckt oder deutlich günstiger ist.
#Schritt-für-Schritt-Einstieg
- 01Den Vulkan-Treiber prüfenUnter Windows enthält der Radeon-Treiber Vulkan und Ollama erfordert keine zusätzlichen Schritte. Unter Linux installieren Sie die Vulkan-Komponenten von Mesa (RADV) oder den AMD-Treiber, wie die Ollama-Dokumentation beschreibt.
- 02Ollama installieren oder llama.cpp kompilierenOllama aktiviert Vulkan standardmäßig, sobald das Backend installiert ist. Kompilieren Sie llama.cpp mit der Option -DGGML_VULKAN=on.
- 03Den Grafikkartenzugriff unter Linux ermöglichenFügen Sie den Benutzer ollama zur Gruppe render hinzu, wenn die Karte nicht erkannt wird. Damit Ollama den freien VRAM auslesen kann, starten Sie es als root oder gewähren Sie ihm die im folgenden Befehl angegebene Capability.
- 04Ein erstes Modell startenLaden Sie ein 8B-Modell oder Gemma 4 12B in Q4_K_M herunter, starten Sie es mit dem Befehl ollama run und prüfen Sie anschließend mit ollama ps, dass das Modell auf der GPU und nicht auf dem Prozessor geladen ist.
- 05Auf dem eigenen System messenFühren Sie llama-bench mit derselben GGUF-Datei aus, die in der öffentlichen Diskussion verwendet wurde, um Ihre Karte mit den dortigen Ergebnissen zu vergleichen, bevor Sie nach einer Ursache für die geringe Geschwindigkeit suchen.
Wenn Ihnen der Durchsatz unter RADV niedrig erscheint, empfiehlt die Diskussion zu llama.cpp, das Programm mit der Umgebungsvariable RADV_PERFTEST=nogttspill zu starten, die mehrere Leistungsprobleme behebt. Weitere Vulkan-Einstellungen finden Sie im entsprechenden Leitfaden zum Kompilieren.
- llama.cpp mit Vulkan kompilieren, Schritt für Schritt
- Ollama und AMD-GPU: Was ROCm tatsächlich abdeckt
#Grenzen und wann es Zeit ist, auf etwas anderes umzusteigen
Drei Grenzen werden deutlich. Zunächst der Speicher: 12 GB schließen Modelle mit 20 bis 32 Milliarden Parametern aus – in dieser Größenklasse entscheidet sich die Qualität von Code- und Reasoning-Assistenten. Dann die Prompt-Verarbeitung, die Sitzungen mit langen Dokumenten mühsam macht. Schließlich die Unterstützung: Bei einer Karte außerhalb der offiziellen Liste hängt sie vom guten Willen bei den Updates von Vulkan und llama.cpp ab, ohne langfristige Garantie.
| Ihr Bedarf | Bei der RX 6700 XT bleiben? | Mögliche Alternative |
|---|---|---|
| Täglicher Chat mit einem 8B- bis 12B-Modell | Ja | Keine |
| Lokaler Code-Assistent mit 14B | Ja, kurzer Kontext | Eine Karte mit 16 GB Speicher, wenn der Kontext wächst |
| Modelle mit 20 bis 30 Milliarden Parametern (gpt-oss 20B, Devstral 24B) | Nein, nicht genügend Speicher | Grafikkarte mit 16 bis 20 GB, eigene Seite dazu weiter unten |
| RAG mit umfangreichen Dokumenten | Möglich, aber langsam bis zum ersten Wort | Grafikkarte mit schnellerer Prompt-Verarbeitung |
| Offizieller Support gewährleistet | Nein | Radeon RX 7000 oder 9000, RTX |
- Radeon RX 7700 XT, der nächste Schritt zu RDNA 3 mit 12 GB und offizieller Unterstützung
- Radeon RX 7800 XT, 16 GB für den Umstieg auf Modelle mit 20 bis 24 Milliarden Parametern
#Fazit 2026
- Sie lohnt sich
- Wenn sie bereits in Ihrem Rechner steckt: Sie ist eine der wenigen Karten aus dem Jahr 2021, auf denen noch ein 14B-Modell in Q4 läuft und die dabei eine Generationsleistung von mehr als 80 % ihres theoretischen Maximums erreichen.
- Kaufen Sie lieber eine RTX 3060 12 GB
- Wenn Sie bei null anfangen und dasselbe Budget anpeilen: doppelt so schnelle Prompt-Verarbeitung und keine Software-Workarounds.
- Wechseln Sie die Grafikkarte
- Sobald Sie Modelle mit 20 bis 30 Milliarden Parametern anvisieren: Die Preise ändern sich jede Woche, und auf /prix-gpu-ia finden Sie den Preis pro GB VRAM.
- Preise für Grafikkarten für lokale KI, zweimal pro Woche aktualisiert
- Ollama-Dokumentation: unterstützte GPUs, ROCm und Vulkan
- Vulkan-Scoreboard des Repositorys llama.cpp (Llama 2 7B Q4_0)
- ROCm-GPU-Kompatibilität, AMD-Dokumentation
#Häufig gestellte Fragen
RX 6700 XT LLM: Welche Modelle können gestartet werden?+
Funktioniert eine 6700 XT mit Ollama?+
Ist ROCm auf der RX 6700 XT praktikabel?+
Wie viele Tokens pro Sekunde auf einer RX 6700 XT?+
RX 6700 XT oder RTX 3060 12 GB für einen LLM?+
Wann sollte die RX 6700 XT für die lokale KI abgelöst werden?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.