Welchen LLM können Sie auf einer AMD Radeon 6700XT ausführen?
Die Suchanfrage „6700xt llm“ ist häufig bei Personen anzutreffen, die eine Grafikkarte der RDNA-2-Generation besitzen und ein lokales Modell nutzen möchten, ohne eine neue GPU zu kaufen. Gute Nachrichten für die Kombination 6700xt llm: Die 12 GB GDDR6 dieser Karte reichen für Modelle mit 7 bis 14 Milliarden Parametern in 4-Bit-Quantisierung aus, mit einem komfortablen Durchsatz für Chat, Code und Dokumentzusammenfassungen. Die wichtigste Einschränkung ist nicht die Rechenleistung, sondern der Grafikspeicher. Die zweite Hürde betrifft die Software: Die RX 6700 XT wird von ROCm nicht offiziell unterstützt, weshalb eine Anpassung oder das Vulkan-Backend erforderlich ist. Dieser Artikel erläutert die relevanten Spezifikationen, den VRAM-Bedarf je nach Quantisierung, realistische Durchsatzraten und die Lizenzen. Anschließend beantwortet er häufige Fragen, bevor er Sie zum Konfigurator führt.
Die RX 6700 XT bei der lokalen Inferenz
Auf dem Papier ist die Radeon RX 6700 XT eine Gaming-Grafikkarte aus dem Jahr 2021. Für ein LLM zählen drei Zahlen wirklich.
- VRAM : 12 GB GDDR6, 192-Bit-Bus.
- Speicherbandbreite : 384 GB/s. Dieser Wert begrenzt die Generierungsrate in Tokens pro Sekunde, da bei jedem generierten Token sämtliche aktiven Gewichte erneut gelesen werden.
- Architektur : RDNA 2, Identifikator
gfx1031, 40 Recheneinheiten, ohne dedizierte Matrixkerne.
Zum Vergleich: Eine Karte mit 16 GB wie in der LLM-Leitfaden für die Radeon RX 6800 XT ermöglicht den Betrieb von 24B-Modellen in Q4, und eine 24-GB-Karte wie die RX 7900 XTX erreicht 32B. Die 6700 XT bleibt in der 12-GB-Klasse, derselben wie die RTX 3060 12 GB von NVIDIA. Der spezieller Leitfaden zur RX 6700 XT und die Auswahl bestes LLM für Radeon RX 6700 XT listen die Modelle aus dem Katalog auf, die in dieses Speicherbudget passen.
VRAM-Verbrauch je nach Quantisierung: Q4, Q5, Q8, FP16
Die Berechnungsregel ist einfach: Anzahl der Parameter × Bytes pro Parameter, plus der KV-Cache, der mit der Kontextlänge wächst. Die folgenden Größenordnungen setzen einen Kontext von 8.192 Tokens und einen 8-Bit-KV-Cache voraus; sie wurden anhand gängiger GGUF-Dateien geschätzt.
- Modell mit 7 bis 8B Parametern : Q4 ≈ 5 GB, Q5 ≈ 6 GB, Q8 ≈ 9 GB, FP16 ≈ 16 GB. Alle Varianten bis einschließlich Q8 passen in 12 GB, FP16 nicht.
- Modell 12 bis 14B : Q4 ≈ 8 bis 9 GB, Q5 ≈ 10 GB, Q8 ≈ 15 GB. Q4 und Q5 passen in den VRAM, bei Q8 wird ein Teil in den Systemspeicher ausgelagert.
- Modell mit 24 bis 27B : Q4 ≈ 15 bis 17 GB. Passt nicht vollständig in den Speicher; Q3 mit 12 GB ist möglich, beeinträchtigt aber die Qualität.
- MoE-Modell mit 30 Milliarden Parametern, davon 3 Milliarden aktiv : Q4 ≈ 18 GB Modellgewichte, aber bei jedem Token werden nur die aktiven Experten gelesen. Wenn die Experten auf die CPU ausgelagert werden, bleibt der Durchsatz brauchbar.
Der Kipppunkt ist klar: Oberhalb von 12 GB lagern llama.cpp und Ollama die verbleibenden Schichten auf die CPU aus, und der Durchsatz sinkt um den Faktor 5 bis 10. Der Leitfaden „Welcher LLM für 12 GB VRAM?“ listet die Kombinationen aus Größe × Quantisierung × Kontext, die 100 % auf GPU bleiben.
Das oberste Katalogprodukt wird nicht laufen lassen
Ein Teil des Katalogs von quelllm.fr liegt außerhalb der Möglichkeiten einer 6700 XT. Das sollte man klar sagen, statt Hoffnungen auf ein Softwarewunder zu wecken.
- DeepSeek R1 671B : ca. 400 GB bei Q4, Lizenz MIT. Lokal auf einem normalen PC nicht möglich, unabhängig von der Grafikkarte.
- Qwen 3 235B-A22B : ~142 GB in Q4, Apache 2.0. Auch mit 128 GB RAM ist dies außer Reichweite.
- DeepSeek V4 Flash 284B : ~170 GB in Q4, MIT. Nur für Multi-GPU-Server oder High-End-Macs mit vereinheitlichtem Speicher geeignet.
- GLM 5.3 Flash 320B-A18B : ~186 GB im Q4, MIT. Gleiches Urteil.
Der interessante Grenzfall betrifft MoE-Modelle mit etwa 120B Parametern und nur wenigen aktiven Parametern. Qwen 3.5 122B-A10B benötigt in Q4 etwa 73 GB und steht unter der Apache-2.0-Lizenz, Qwen3.8 Flash Next 125B-A6B ~72 GB mit nur 6B aktiven Parametern und Mistral Small 4 ~72 GB unter Apache 2.0. Mit 64 GB System-RAM und den 12 GB der Grafikkarte kann llama.cpp diese Modelle laden, indem es die Experten auf die CPU auslagert. Der Durchsatz liegt dann bei wenigen Tokens pro Sekunde, geschätzt zwischen 3 und 8 je nach RAM und CPU; dies muss auf Ihrer Konfiguration bestätigt werden. Das ist für nächtliche Batchverarbeitung nutzbar, nicht für einen interaktiven Chat. Die Modellgewichte sind veröffentlicht auf die Alibaba-Seite auf Hugging Face et die Mistral-Seite auf Hugging Face.
Tokens/sec in der Praxis und Softwareauswahl
Bei RDNA 2 hängt der Durchsatz ebenso stark vom Backend wie vom Modell ab. Zwei Wege funktionieren.
- Ollama mit ROCm : Die 6700 XT ist nicht in der offiziellen Liste enthalten, aber die Variable
HSA_OVERRIDE_GFX_VERSION=10.3.0sorgt dafür, dass sie als Karte derselben Familie akzeptiert wird. Das vollständige Vorgehen finden Sie im Leitfaden zu Ollama auf AMD-GPUs mit ROCm ; das Repository Ollama auf GitHub beschreibt die Umgebungsvariablen. - llama.cpp mit Vulkan : Kein spezifischer Treiber erforderlich, funktioniert unter Windows wie unter Linux. Der Backend-Teil wird im llama.cpp-Repository. Die Generierung ist ähnlich schnell wie mit ROCm, die Prompt-Verarbeitung ist etwas langsamer.
- vLLM : keine realistische Option für RDNA 2; die vLLM-Dokumentation richtet sich an Rechenzentrumskarten und neuere RDNA-3-Karten.
Von der Community auf einer 6700 XT gemessene Größenordnungen, die auf Ihrem Rechner noch zu bestätigen sind:
- 8B in Q4_K_M : 35 bis 45 Tokens pro Sekunde bei der Generierung.
- 14B in Q4_K_M : 18 bis 25 Tokens pro Sekunde.
- MoE 30B-A3B mit Experten auf CPU : 12 bis 20 Tokens pro Sekunde, geschätzt.
- 24B in Q4 mit teilweiser Auslagerung : 4 bis 8 Tokens pro Sekunde, geschätzt.
Für eine Chat-Oberfläche auf Basis von Ollama, Open WebUI lässt sich in einem Container bereitstellen und verwaltet den Verlauf, die Dokumente und mehrere Modelle.
Lizenzen und konkrete Anwendungsfälle
Die Lizenz bestimmt, was Sie mit den Ausgaben tun dürfen und ob das Modell in einem Produkt eingesetzt werden kann. Der Katalog zeigt die Lizenz auf jeder Modellseite an; bei den mit 12 GB kompatiblen Modellgrößen sind die wichtigsten Lizenzfamilien Apache 2.0, MIT, Llama Community sowie einige anbietereigene Lizenzen vertreten. Der Lizenzfilter im Katalog ermöglicht es, Lizenzen mit einer Klausel zur Einschränkung der kommerziellen Nutzung von vornherein auszuschließen.
Was die 6700 XT im Alltag gut leistet:
- Code-Assistent : Ein Modell mit 7 bis 14 Milliarden Parametern in Q4 antwortet schnell genug für Codevervollständigung und Codeprüfung in einem Editor. Die HumanEval- und LiveCodeBench-Scores in den Modellprofilen helfen bei der Auswahl zwischen den Kandidaten.
- Zusammenfassung und RAG mit privaten Dokumenten : Ein Kontext von 8k bis 16k passt bei einem 8B-Modell in Q5 in den VRAM; darüber hinaus die Quantisierung des KV-Caches reduzieren.
- Chat auf Französisch : Modelle bevorzugen, deren Datenblatt einen mehrsprachigen MMLU-Score oder eine Bewertung auf Französisch angibt, statt sich allein auf den englischen MMLU-Score zu stützen.
- Offline-Batchverarbeitung : Klassifikation, Extraktion von Feldern, Umformulierung, wobei der Durchsatz weniger wichtig ist als die Vertraulichkeit.
Um Scores zwischen Modellen zu vergleichen, wird der Open LLM Leaderboard bleibt die öffentliche Referenz, mit der üblichen Vorsicht: Ein Benchmark misst eine spezifische Aufgabe, nicht Ihren tatsächlichen Gebrauch.
Sollte man die Grafikkarte wechseln?
Wenn Sie an die Grenze von 12 GB stoßen, gibt es bei AMD drei weitere Ausbaustufen.
- 16 GB : gebrauchte RX 6800 XT, RX 7800 XT oder neue RX 9060 XT. Der Benchmark der 9060 XT 16 GB zeigt, was 4 GB mehr und RDNA 4 bei 24B-Modellen bringen.
- 20 GB : RX 7900 XT, auf der ein 27B-Modell in Q5 Platz findet.
- 24 GB : RX 7900 XTX, die einzige AMD-Grafikkarte für Endverbraucher, die ein Modell mit 32 Milliarden Parametern in Q4 mit einem sinnvoll nutzbaren Kontext laden kann.
Le Vergleichswerkzeug stellt zwei Datenblätter nebeneinander dar, um zu zeigen, was der zusätzliche VRAM bei einem bestimmten Modell tatsächlich ermöglicht.
FAQ
Q: Ist die RX 6700 XT mit ROCm kompatibel?
Nicht offiziell. AMD nennt gfx1031 unter den unterstützten ROCm-Zielen auf. In der Praxis funktionieren für ROCm kompilierte Versionen von Ollama und llama.cpp mit der erzwungenen Einstellung HSA_OVERRIDE_GFX_VERSION=10.3.0, die die Karte als ein gfx1030. Falls diese Einstellung Probleme verursacht, bietet das Vulkan-Backend von llama.cpp einen vergleichbaren Durchsatz, ohne von ROCm abhängig zu sein.
F: Welche maximale Modellgröße ist auf 12 GB möglich?
Ein 14B-Modell in Q4 oder Q5 bleibt bei 8k Kontext vollständig im VRAM. Ein 24B- oder 27B-Modell erfordert eine starke Q3-Quantisierung oder eine teilweise Auslagerung auf die CPU, wobei der Durchsatz deutlich sinkt. MoE-Modelle mit 30B Parametern, davon 3B aktiv, sind jenseits von 14B der beste Kompromiss, sofern die Experten auf den Prozessor ausgelagert werden.
F: Kann DeepSeek R1 671B oder Qwen 3 235B auf einer 6700 XT laufen?
Nein. DeepSeek R1 671B benötigt ~400 GB in Q4, Qwen 3 235B-A22B ~142 GB. Keine Kombination aus RAM und 12 GB VRAM auf einem Desktop-PC reicht dafür aus. MoE-Modelle mit etwa 120 Milliarden Parametern, davon 6 bis 10 Milliarden aktiv, bilden die absolute Grenze, mit 64 GB RAM und einem Durchsatz von einigen Tokens pro Sekunde.
F: Windows oder Linux für ein LLM auf einer 6700 XT?
Beide funktionieren. Unter Windows machen das Vulkan-Backend von llama.cpp und neuere Ollama-Builds die Installation von ROCm überflüssig. Unter Linux ermöglicht ROCm mit der Override-Variablen eine etwas schnellere Prompt-Verarbeitung. Der Unterschied beim Generierungsdurchsatz liegt schätzungsweise weiterhin bei etwa 10 % und rechtfertigt für sich allein keinen Betriebssystemwechsel.
F: Wie viel Systemspeicher sollte zusätzlich bereitgestellt werden?
32 GB reichen für Modelle, die in den VRAM passen, und für ein MoE-Modell mit 30B-A3B und Experten auf der CPU aus. Ein Wechsel auf 64 GB lohnt sich nur, um MoE-Modelle mit etwa 120B wie Qwen3.8 Flash Next 125B-A6B vollständig in den Arbeitsspeicher auszulagern und auszuprobieren, allerdings mit geringerem Durchsatz.
F: Ist ein langer Kontext mit 12 GB möglich?
Ja, mit Kompromissen. Der KV-Cache eines 8B-Modells belegt bei 16 Bit etwa 1 GB pro 8k Tokens; wird er auf 8 Bit quantisiert, erreicht ein 8B-Modell in Q4 innerhalb von 12 GB einen Kontext von 32k. Ein 14B-Modell ist unter denselben Bedingungen auf 16k begrenzt. Die Modelleinträge im Katalog geben den maximal unterstützten Kontext jedes Modells an.
Fazit
Für die Suchanfrage 6700xt llm lässt sich die Antwort in einem Satz zusammenfassen: Ein Modell mit 7 bis 14 Milliarden Parametern in Q4 oder Q5, geladen über Ollama mit ROCm-Override oder über llama.cpp mit Vulkan, läuft vollständig im VRAM mit einem komfortablen Durchsatz. MoE-Modelle mit ausgelagerten Experten erweitern die Möglichkeiten, die größten Modelle im Katalog bleiben außer Reichweite. Um die genaue Liste der Modelle zu erhalten, die mit Ihren 12 GB, Ihrem RAM und der gewünschten Lizenz kompatibel sind, nutzen Sie den Konfigurator quelllm.fr.
Das Hardware-Setup für die lokale Ausführung eines LLM
Um diese Modelle komfortabel lokal auszuführen, benötigt man RTX 5070 Ti bietet ein hervorragendes Preis-Leistungs-Verhältnis. Vergleichen Sie die Preise:
Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass Ihnen Mehrkosten entstehen. Als Amazon-Partner verdient QuelLLM an qualifizierten Käufen.