Einsteiger 11 Min.Radeon RX 6000

Welcher LLM auf der Radeon RX 6700 XT (12 GB) ?

Direkte Antwort

Die RX 6700 XT (12 GB, 384 GB/s) betreibt problemlos Modelle bis zu 14B in Q4 (etwa 9 GB) sowie ein 12B-Modell wie Gemma 4 12B mit Reserven für den Kontext. Sie nutzt Vulkan statt ROCm: Sie steht weder auf der offiziellen ROCm-Liste noch auf der Liste von Ollama. Bei der Generierung erreicht oder übertrifft sie sogar die Leistung einer RTX 3060 mit 12 GB; bei der Prompt-Verarbeitung ist sie fast doppelt so langsam.

Diese Karte aus dem Jahr 2021 wurde nie für KI konzipiert, doch die Software hat sie trotzdem nicht vergessen. Dieser Leitfaden erklärt, was sie heute ausführen kann, über welchen Softwarepfad, mit welcher Geschwindigkeit laut veröffentlichten Messungen und wann sich ein Austausch mehr lohnt, als hartnäckig an ihr festzuhalten.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Kaufalternative für diesen Guide: Radeon RX 9070 XT 16 GB.

Warum diese Wahl? Unsere vollständige Übersicht zu Radeon RX 9070 XT 16 GB →

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#Was leistet eine RX 6700 XT im Jahr 2026?

Eine Radeon RX 6700 XT eignet sich sehr gut als Einstiegskarte für ein lokales LLM, sofern Sie drei Tatsachen akzeptieren: Ihre 12 GB Speicher reichen für ein Modell mit 14 Milliarden Parametern in Q4 (etwa 9 GB Modellgewichte), aber nicht für ein 24B-Modell; zuverlässig lässt sie sich über Vulkan mit llama.cpp oder Ollama betreiben, da AMD sie nicht in ROCm auflistet; und ihre durch die Bandbreite von 384 GB/s begrenzte Generierungsgeschwindigkeit reicht für eine flüssige Unterhaltung mit einem 8B- bis 12B-Modell aus. Bei einem 7B-Modell in Q4_0 ergibt eine im llama.cpp-Repository veröffentlichte Messung 83,88 Tokens pro Sekunde bei der Generierung unter Vulkan, etwas mehr als die in derselben Diskussion gemessene RTX 3060 mit 12 GB. Der eigentliche Schwachpunkt ist das Einlesen des Prompts, das doppelt so langsam ist.

Architektur
RDNA 2, Chip Navi 22, veröffentlicht am 18. März 2021 (Wikipedia-Seite zur RX 6000-Serie)
Berechnung
2.560 Stream-Prozessoren, 40 Recheneinheiten.
Speicher
12 GB GDDR6, Bus 192 Bit, 384 GB/s.
Verbrauch
230 W Kartenleistung.
Preis
Hier nicht angegeben: Die Gebrauchtpreise ändern sich jede Woche. Weitere Informationen finden Sie unter /prix-gpu-ia.

#Ollama, ROCm oder Vulkan: der Weg, der funktioniert

Die häufigste Falle bei dieser Karte ist die Suche nach einer ROCm-Anleitung. Die Ollama-Dokumentation listet für Linux Radeon-RX-Modelle von der 6800 bis zur 9070 XT auf: Die 6700 XT ist nicht dabei. Die Kompatibilitätstabelle von AMD nennt für ROCm bei RDNA 2 nur professionelle Karten wie die PRO W6800 oder die V620. Ollama erweitert diese Unterstützung durch Vulkan, das bei installiertem Backend standardmäßig aktiviert ist. Dieser Weg steht auch der 6700 XT offen. Für ROCm gibt es einen Workaround: Die Variable HSA_OVERRIDE_GFX_VERSION erzwingt ein ähnliches LLVM-Ziel, ist aber ausschließlich für Experimente vorgesehen.

Drei Softwareoptionen für eine RX 6700 XT
PfadStatus für diese KarteWann diese Wahl sinnvoll ist
Vulkan (Ollama, llama.cpp, LM Studio)Funktioniert, öffentlich gemessen unter llama.cppStandardauswahl, unter Windows wie unter Linux
Offizielles ROCmKarte fehlt in der ROCm-Liste und in der Liste von OllamaZu vermeiden: keine garantierte Unterstützung
Erzwungenes ROCm (HSA_OVERRIDE_GFX_VERSION)Von Ollama dokumentierter Workaround für andere KartenNur zum Testen, ohne einen nachgewiesenen Vorteil zu erwarten
!
Verlassen Sie sich bei dieser Karte nicht auf ROCm
Ollama schreibt, dass ROCm nicht alle AMD-Karten unterstützt, und schlägt die Variable HSA_OVERRIDE_GFX_VERSION zur Fehlerbehebung vor. Für die 6700 XT zeigt keine Quelle einen Vorteil gegenüber Vulkan, dessen Ergebnisse veröffentlicht sind. Lesen Sie vor jedem Versuch mit dem Befehl rocminfo die Kennung Ihres GPU-Ziels aus.

#Was in 12 GB VRAM passt

Die Faustregel dieser Website bleibt dieselbe: Speicherbedarf der Modellgewichte in Q4 plus KV-Cache plus eine Reserve für Treiber und Bildschirmausgabe. Bei 12 GB bleiben mit einem realistischen Speicherbudget etwa 11 GB für das Modell und seinen Kontext, sofern die Karte nicht den Bildschirm ansteuert. Die folgenden Größen stammen aus dem QuelLLM-Katalog und unseren üblichen Richtwerten; sie beziehen sich ausschließlich auf die Modellgewichte.

Was auf eine Grafikkarte mit 12 GB passt (Q4, nur Modellgewichte)
ModellGewichte in Q4Verbleibt für den KontextFazit
Llama 3.1 8B≈ 6 GB≈ 5 bis 6 GBSehr gut nutzbar, langer Kontext möglich
Gemma 4 12B≈ 7 GB≈ 4 bis 5 GBGut nutzbar, mittlerer bis langer Kontext
Phi-4 14B≈ 9 GB≈ 2 bis 3 GBPasst, Kontext begrenzen
gpt-oss 20B≈ 13 GBnegativPasst nicht vollständig in den VRAM: teilweise Auslagerung auf den Prozessor
Devstral Small 2 24B≈ 14 GBnegativZu groß für 12 GB in Q4

Der KV-Cache wächst mit der Länge des Gesprächs. Das erklärt, warum ein 14B-Modell auf dem Papier in den Speicher „passt“, aber sehr langsam wird, sobald der Gesprächsverlauf länger wird. Der VRAM-Rechner der Website gibt den genauen Gesamtbedarf für Ihr Modell und Ihren Kontext an, und der Leitfaden zur Quantisierung des KV-Caches erklärt, wie sich ein oder zwei Gigabyte freigeben lassen. Für alle Karten mit 12 GB vergleicht die entsprechende Seite die Modelle, ohne sich auf AMD zu beschränken.

#Gemessene Durchsatzwerte und Bandbreitenobergrenze

Keine der auf dieser Seite genannten Durchsatzangaben wurde von dieser Website selbst gemessen. Die Zahlen stammen aus der öffentlichen Diskussion im llama.cpp-Repository, in der die Karten unter Vulkan mit demselben Modell, Llama 2 7B in Q4_0 (3,56 GiB), und dem Befehl llama-bench verglichen werden. Dabei zählen zwei Werte: pp512, die Lesegeschwindigkeit für einen Prompt mit 512 Tokens, und tg128, die Geschwindigkeit beim Schreiben von 128 Tokens. Für die RX 6700 XT nennt die Diskussion 1.051 Tokens pro Sekunde beim Lesen und 83,88 bei der Generierung; mit aktivierter Flash Attention sind es 1.011 und 81,86.

Dieses Ergebnis lässt sich mit einer einfachen Obergrenze vergleichen: Bei der Generierung muss die Grafikkarte für jedes Token sämtliche Gewichte erneut lesen. Die maximale Geschwindigkeit entspricht daher ungefähr der Bandbreite geteilt durch die Modellgröße. Hier ergeben 384 GB/s bei 3,82 GB an Gewichten eine theoretische Obergrenze von 100 Tokens pro Sekunde; die Karte erreicht 83 % davon. Das ist eine gute Ausnutzung, besser als bei mehreren neueren Karten in derselben Diskussion.

Schätzung für gängige Modelle (Berechnung, nicht Messung)
Modell (Q4)ModellgrößeTheoretischer Höchstwert 384 GB/sRealistische Größenordnung (83 %)
Llama 3.1 8B≈ 6 GB≈ 64 Tokens/s≈ 50 bis 55 Tokens pro Sekunde
Gemma 4 12B≈ 7 GB≈ 55 Tokens/s≈ 45 Tokens/s
Phi-4 14B≈ 9 GB≈ 43 Tokens/s≈ 35 Tokens/s

Diese Größenordnungen setzen voraus, dass die am 7B-Modell gemessene Effizienz auch bei größeren Modellen erreicht wird, was nicht garantiert ist: Ein Treiber, eine Version von llama.cpp oder eine andere Quantisierung kann das Ergebnis um mehrere Punkte verschieben. Merken Sie sich für die Verarbeitung von Prompts nur das Verhältnis zwischen den Grafikkarten: Die Prompt-Verarbeitung ist es, die bei RAG mit langen Dokumenten ins Gewicht fällt.

#Im Vergleich zur RTX 3060 mit 12 GB: schneller bei der Generierung, langsamer bei der Prompt-Verarbeitung

Beim üblichen Vergleich gilt die RTX 3060 mit 12 GB dank CUDA als überlegen. Die veröffentlichten Messungen unter Vulkan relativieren diese Annahme. Bei der Generierung liegt die RX 6700 XT in beiden Modi vor der RTX 3060; beim Einlesen des Prompts ist die RTX 3060 fast doppelt so leistungsfähig. Beide Messreihen stammen aus derselben Diskussion, wurden aber mit unterschiedlichen Versionen von llama.cpp durchgeführt: Verstehen Sie den Abstand als Anhaltspunkt für die Größenordnung, nicht als endgültige Rangfolge.

RX 6700 XT und RTX 3060 unter Vulkan (Llama 2 7B Q4_0, Diskussion über llama.cpp)
MessungRX 6700 XTRTX 3060 (12 GB)
Prompt-Verarbeitung (pp512), ohne Flash Attention1 051,20 t/s1 815,70 t/s
Generierung (tg128), ohne Flash Attention83,88 t/s75,94 t/s
Prompt-Verarbeitung (pp512) mit Flash Attention1 010,90 t/s2 012,88 t/s
Generierung (tg128) mit Flash Attention81,86 t/s80,59 t/s

Die praktische Konsequenz: Für Gespräche mit einem Modell sind beide Karten gleichwertig; bei Fragen zu einem langen Dokument liefert die RTX 3060 das erste Wort schneller. CUDA behält zudem den Vorteil seines Ökosystems, in dem Sie weniger Umgehungslösungen kennen müssen. Bei gleichem Gebrauchtpreis bleibt die RTX 3060 mit 12 GB die vorsichtige Wahl, und die 6700 XT ist nur dann ein gutes Geschäft, wenn sie bereits in Ihrem PC steckt oder deutlich günstiger ist.

#Schritt-für-Schritt-Einstieg

  1. 01
    Den Vulkan-Treiber prüfen
    Unter Windows enthält der Radeon-Treiber Vulkan und Ollama erfordert keine zusätzlichen Schritte. Unter Linux installieren Sie die Vulkan-Komponenten von Mesa (RADV) oder den AMD-Treiber, wie die Ollama-Dokumentation beschreibt.
  2. 02
    Ollama installieren oder llama.cpp kompilieren
    Ollama aktiviert Vulkan standardmäßig, sobald das Backend installiert ist. Kompilieren Sie llama.cpp mit der Option -DGGML_VULKAN=on.
  3. 03
    Den Grafikkartenzugriff unter Linux ermöglichen
    Fügen Sie den Benutzer ollama zur Gruppe render hinzu, wenn die Karte nicht erkannt wird. Damit Ollama den freien VRAM auslesen kann, starten Sie es als root oder gewähren Sie ihm die im folgenden Befehl angegebene Capability.
  4. 04
    Ein erstes Modell starten
    Laden Sie ein 8B-Modell oder Gemma 4 12B in Q4_K_M herunter, starten Sie es mit dem Befehl ollama run und prüfen Sie anschließend mit ollama ps, dass das Modell auf der GPU und nicht auf dem Prozessor geladen ist.
  5. 05
    Auf dem eigenen System messen
    Führen Sie llama-bench mit derselben GGUF-Datei aus, die in der öffentlichen Diskussion verwendet wurde, um Ihre Karte mit den dortigen Ergebnissen zu vergleichen, bevor Sie nach einer Ursache für die geringe Geschwindigkeit suchen.
Terminal
sudo setcap cap_perfmon+ep /usr/local/bin/ollama
# llama.cpp avec Vulkan
cmake .. -DGGML_VULKAN=on -DCMAKE_BUILD_TYPE=Release
./bin/llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

Wenn Ihnen der Durchsatz unter RADV niedrig erscheint, empfiehlt die Diskussion zu llama.cpp, das Programm mit der Umgebungsvariable RADV_PERFTEST=nogttspill zu starten, die mehrere Leistungsprobleme behebt. Weitere Vulkan-Einstellungen finden Sie im entsprechenden Leitfaden zum Kompilieren.

#Grenzen und wann es Zeit ist, auf etwas anderes umzusteigen

Drei Grenzen werden deutlich. Zunächst der Speicher: 12 GB schließen Modelle mit 20 bis 32 Milliarden Parametern aus – in dieser Größenklasse entscheidet sich die Qualität von Code- und Reasoning-Assistenten. Dann die Prompt-Verarbeitung, die Sitzungen mit langen Dokumenten mühsam macht. Schließlich die Unterstützung: Bei einer Karte außerhalb der offiziellen Liste hängt sie vom guten Willen bei den Updates von Vulkan und llama.cpp ab, ohne langfristige Garantie.

Wann bleiben, wann wechseln
Ihr BedarfBei der RX 6700 XT bleiben?Mögliche Alternative
Täglicher Chat mit einem 8B- bis 12B-ModellJaKeine
Lokaler Code-Assistent mit 14BJa, kurzer KontextEine Karte mit 16 GB Speicher, wenn der Kontext wächst
Modelle mit 20 bis 30 Milliarden Parametern (gpt-oss 20B, Devstral 24B)Nein, nicht genügend SpeicherGrafikkarte mit 16 bis 20 GB, eigene Seite dazu weiter unten
RAG mit umfangreichen DokumentenMöglich, aber langsam bis zum ersten WortGrafikkarte mit schnellerer Prompt-Verarbeitung
Offizieller Support gewährleistetNeinRadeon RX 7000 oder 9000, RTX

#Fazit 2026

Sie lohnt sich
Wenn sie bereits in Ihrem Rechner steckt: Sie ist eine der wenigen Karten aus dem Jahr 2021, auf denen noch ein 14B-Modell in Q4 läuft und die dabei eine Generationsleistung von mehr als 80 % ihres theoretischen Maximums erreichen.
Kaufen Sie lieber eine RTX 3060 12 GB
Wenn Sie bei null anfangen und dasselbe Budget anpeilen: doppelt so schnelle Prompt-Verarbeitung und keine Software-Workarounds.
Wechseln Sie die Grafikkarte
Sobald Sie Modelle mit 20 bis 30 Milliarden Parametern anvisieren: Die Preise ändern sich jede Woche, und auf /prix-gpu-ia finden Sie den Preis pro GB VRAM.

#Häufig gestellte Fragen

FAQ
RX 6700 XT LLM: Welche Modelle können gestartet werden?+
Modelle mit bis zu 14 Milliarden Parametern in Q4, also etwa 9 GB für die Modellgewichte, zuzüglich des Kontexts: Llama 3.1 8B, Gemma 4 12B, Phi-4 14B. Ein 20B-Modell wie gpt-oss (etwa 13 GB) oder ein 24B-Modell überschreitet die 12 GB und wird teilweise auf dem Prozessor ausgeführt, wodurch die Geschwindigkeit deutlich sinkt.
Funktioniert eine 6700 XT mit Ollama?+
Ja, über Vulkan. Ollama nennt Vulkan nicht in seiner ROCm-Liste, die ab der RX 6800 unter Linux beginnt, aber Vulkan wird standardmäßig aktiviert, sobald der Backend installiert ist. Prüfen Sie mit dem Befehl ollama ps, ob der Modell korrekt auf dem GPU geladen ist.
Ist ROCm auf der RX 6700 XT praktikabel?+
Offiziell nicht: Die Karte erscheint weder in AMDs ROCm-Kompatibilitätstabelle, die für RDNA 2 nur professionelle Karten nennt, noch in der Ollama-Liste. Es gibt einen Workaround über die Variable HSA_OVERRIDE_GFX_VERSION, doch er bleibt experimentell, und keine öffentliche Messung zeigt einen Vorteil gegenüber Vulkan, dessen Ergebnisse veröffentlicht sind.
Wie viele Tokens pro Sekunde auf einer RX 6700 XT?+
Für Llama 2 7B in Q4_0 nennt die öffentliche Diskussion im llama.cpp-Repository 83,88 Tokens pro Sekunde bei der Generierung unter Vulkan. Für Gemma 4 12B in Q4 lässt das Verhältnis von Bandbreite zu Modellgewicht etwa 45 Tokens pro Sekunde erwarten: eine berechnete Schätzung, die Sie auf Ihrem eigenen System mit llama-bench überprüfen sollten, bevor Sie sie zitieren.
RX 6700 XT oder RTX 3060 12 GB für einen LLM?+
Bei der Generierung sind beide gleichwertig, wobei die Radeon in den veröffentlichten Vulkan-Messungen sogar leicht vorne liegt. Bei der Verarbeitung des Prompts ist die RTX 3060 fast doppelt so schnell, und CUDA erspart Workarounds. Bei gleichem Gebrauchtpreis bleibt die RTX 3060 12 GB die einfachste Wahl.
Wann sollte die RX 6700 XT für die lokale KI abgelöst werden?+
Wenn Sie Modelle mit 20 bis 32 Milliarden Parametern nutzen möchten, die nicht in 12 GB passen, oder wenn die langsame Verarbeitung langer Prompts Ihre Nutzung beeinträchtigt. Eine Karte mit 16 bis 20 GB, wie die Radeon RX 7800 XT oder 7900 XT, ist dann der nächste logische Schritt.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.