Welchen LLM können Sie auf einer AMD Radeon 6700XT ausführen?

Die Suchanfrage „6700xt llm“ ist häufig bei Personen anzutreffen, die eine Grafikkarte der RDNA-2-Generation besitzen und ein lokales Modell nutzen möchten, ohne eine neue GPU zu kaufen. Gute Nachrichten für die Kombination 6700xt llm: Die 12 GB GDDR6 dieser Karte reichen für Modelle mit 7 bis 14 Milliarden Parametern in 4-Bit-Quantisierung aus, mit einem komfortablen Durchsatz für Chat, Code und Dokumentzusammenfassungen. Die wichtigste Einschränkung ist nicht die Rechenleistung, sondern der Grafikspeicher. Die zweite Hürde betrifft die Software: Die RX 6700 XT wird von ROCm nicht offiziell unterstützt, weshalb eine Anpassung oder das Vulkan-Backend erforderlich ist. Dieser Artikel erläutert die relevanten Spezifikationen, den VRAM-Bedarf je nach Quantisierung, realistische Durchsatzraten und die Lizenzen. Anschließend beantwortet er häufige Fragen, bevor er Sie zum Konfigurator führt.

Die RX 6700 XT bei der lokalen Inferenz

Auf dem Papier ist die Radeon RX 6700 XT eine Gaming-Grafikkarte aus dem Jahr 2021. Für ein LLM zählen drei Zahlen wirklich.

Zum Vergleich: Eine Karte mit 16 GB wie in der LLM-Leitfaden für die Radeon RX 6800 XT ermöglicht den Betrieb von 24B-Modellen in Q4, und eine 24-GB-Karte wie die RX 7900 XTX erreicht 32B. Die 6700 XT bleibt in der 12-GB-Klasse, derselben wie die RTX 3060 12 GB von NVIDIA. Der spezieller Leitfaden zur RX 6700 XT und die Auswahl bestes LLM für Radeon RX 6700 XT listen die Modelle aus dem Katalog auf, die in dieses Speicherbudget passen.

VRAM-Verbrauch je nach Quantisierung: Q4, Q5, Q8, FP16

Die Berechnungsregel ist einfach: Anzahl der Parameter × Bytes pro Parameter, plus der KV-Cache, der mit der Kontextlänge wächst. Die folgenden Größenordnungen setzen einen Kontext von 8.192 Tokens und einen 8-Bit-KV-Cache voraus; sie wurden anhand gängiger GGUF-Dateien geschätzt.

Der Kipppunkt ist klar: Oberhalb von 12 GB lagern llama.cpp und Ollama die verbleibenden Schichten auf die CPU aus, und der Durchsatz sinkt um den Faktor 5 bis 10. Der Leitfaden „Welcher LLM für 12 GB VRAM?“ listet die Kombinationen aus Größe × Quantisierung × Kontext, die 100 % auf GPU bleiben.

Das oberste Katalogprodukt wird nicht laufen lassen

Ein Teil des Katalogs von quelllm.fr liegt außerhalb der Möglichkeiten einer 6700 XT. Das sollte man klar sagen, statt Hoffnungen auf ein Softwarewunder zu wecken.

Der interessante Grenzfall betrifft MoE-Modelle mit etwa 120B Parametern und nur wenigen aktiven Parametern. Qwen 3.5 122B-A10B benötigt in Q4 etwa 73 GB und steht unter der Apache-2.0-Lizenz, Qwen3.8 Flash Next 125B-A6B ~72 GB mit nur 6B aktiven Parametern und Mistral Small 4 ~72 GB unter Apache 2.0. Mit 64 GB System-RAM und den 12 GB der Grafikkarte kann llama.cpp diese Modelle laden, indem es die Experten auf die CPU auslagert. Der Durchsatz liegt dann bei wenigen Tokens pro Sekunde, geschätzt zwischen 3 und 8 je nach RAM und CPU; dies muss auf Ihrer Konfiguration bestätigt werden. Das ist für nächtliche Batchverarbeitung nutzbar, nicht für einen interaktiven Chat. Die Modellgewichte sind veröffentlicht auf die Alibaba-Seite auf Hugging Face et die Mistral-Seite auf Hugging Face.

Tokens/sec in der Praxis und Softwareauswahl

Bei RDNA 2 hängt der Durchsatz ebenso stark vom Backend wie vom Modell ab. Zwei Wege funktionieren.

Von der Community auf einer 6700 XT gemessene Größenordnungen, die auf Ihrem Rechner noch zu bestätigen sind:

Für eine Chat-Oberfläche auf Basis von Ollama, Open WebUI lässt sich in einem Container bereitstellen und verwaltet den Verlauf, die Dokumente und mehrere Modelle.

Lizenzen und konkrete Anwendungsfälle

Die Lizenz bestimmt, was Sie mit den Ausgaben tun dürfen und ob das Modell in einem Produkt eingesetzt werden kann. Der Katalog zeigt die Lizenz auf jeder Modellseite an; bei den mit 12 GB kompatiblen Modellgrößen sind die wichtigsten Lizenzfamilien Apache 2.0, MIT, Llama Community sowie einige anbietereigene Lizenzen vertreten. Der Lizenzfilter im Katalog ermöglicht es, Lizenzen mit einer Klausel zur Einschränkung der kommerziellen Nutzung von vornherein auszuschließen.

Was die 6700 XT im Alltag gut leistet:

Um Scores zwischen Modellen zu vergleichen, wird der Open LLM Leaderboard bleibt die öffentliche Referenz, mit der üblichen Vorsicht: Ein Benchmark misst eine spezifische Aufgabe, nicht Ihren tatsächlichen Gebrauch.

Sollte man die Grafikkarte wechseln?

Wenn Sie an die Grenze von 12 GB stoßen, gibt es bei AMD drei weitere Ausbaustufen.

Le Vergleichswerkzeug stellt zwei Datenblätter nebeneinander dar, um zu zeigen, was der zusätzliche VRAM bei einem bestimmten Modell tatsächlich ermöglicht.

FAQ

Q: Ist die RX 6700 XT mit ROCm kompatibel?

Nicht offiziell. AMD nennt gfx1031 unter den unterstützten ROCm-Zielen auf. In der Praxis funktionieren für ROCm kompilierte Versionen von Ollama und llama.cpp mit der erzwungenen Einstellung HSA_OVERRIDE_GFX_VERSION=10.3.0, die die Karte als ein gfx1030. Falls diese Einstellung Probleme verursacht, bietet das Vulkan-Backend von llama.cpp einen vergleichbaren Durchsatz, ohne von ROCm abhängig zu sein.

F: Welche maximale Modellgröße ist auf 12 GB möglich?

Ein 14B-Modell in Q4 oder Q5 bleibt bei 8k Kontext vollständig im VRAM. Ein 24B- oder 27B-Modell erfordert eine starke Q3-Quantisierung oder eine teilweise Auslagerung auf die CPU, wobei der Durchsatz deutlich sinkt. MoE-Modelle mit 30B Parametern, davon 3B aktiv, sind jenseits von 14B der beste Kompromiss, sofern die Experten auf den Prozessor ausgelagert werden.

F: Kann DeepSeek R1 671B oder Qwen 3 235B auf einer 6700 XT laufen?

Nein. DeepSeek R1 671B benötigt ~400 GB in Q4, Qwen 3 235B-A22B ~142 GB. Keine Kombination aus RAM und 12 GB VRAM auf einem Desktop-PC reicht dafür aus. MoE-Modelle mit etwa 120 Milliarden Parametern, davon 6 bis 10 Milliarden aktiv, bilden die absolute Grenze, mit 64 GB RAM und einem Durchsatz von einigen Tokens pro Sekunde.

F: Windows oder Linux für ein LLM auf einer 6700 XT?

Beide funktionieren. Unter Windows machen das Vulkan-Backend von llama.cpp und neuere Ollama-Builds die Installation von ROCm überflüssig. Unter Linux ermöglicht ROCm mit der Override-Variablen eine etwas schnellere Prompt-Verarbeitung. Der Unterschied beim Generierungsdurchsatz liegt schätzungsweise weiterhin bei etwa 10 % und rechtfertigt für sich allein keinen Betriebssystemwechsel.

F: Wie viel Systemspeicher sollte zusätzlich bereitgestellt werden?

32 GB reichen für Modelle, die in den VRAM passen, und für ein MoE-Modell mit 30B-A3B und Experten auf der CPU aus. Ein Wechsel auf 64 GB lohnt sich nur, um MoE-Modelle mit etwa 120B wie Qwen3.8 Flash Next 125B-A6B vollständig in den Arbeitsspeicher auszulagern und auszuprobieren, allerdings mit geringerem Durchsatz.

F: Ist ein langer Kontext mit 12 GB möglich?

Ja, mit Kompromissen. Der KV-Cache eines 8B-Modells belegt bei 16 Bit etwa 1 GB pro 8k Tokens; wird er auf 8 Bit quantisiert, erreicht ein 8B-Modell in Q4 innerhalb von 12 GB einen Kontext von 32k. Ein 14B-Modell ist unter denselben Bedingungen auf 16k begrenzt. Die Modelleinträge im Katalog geben den maximal unterstützten Kontext jedes Modells an.

Fazit

Für die Suchanfrage 6700xt llm lässt sich die Antwort in einem Satz zusammenfassen: Ein Modell mit 7 bis 14 Milliarden Parametern in Q4 oder Q5, geladen über Ollama mit ROCm-Override oder über llama.cpp mit Vulkan, läuft vollständig im VRAM mit einem komfortablen Durchsatz. MoE-Modelle mit ausgelagerten Experten erweitern die Möglichkeiten, die größten Modelle im Katalog bleiben außer Reichweite. Um die genaue Liste der Modelle zu erhalten, die mit Ihren 12 GB, Ihrem RAM und der gewünschten Lizenz kompatibel sind, nutzen Sie den Konfigurator quelllm.fr.

Das Hardware-Setup für die lokale Ausführung eines LLM

Um diese Modelle komfortabel lokal auszuführen, benötigt man RTX 5070 Ti bietet ein hervorragendes Preis-Leistungs-Verhältnis. Vergleichen Sie die Preise:

Darty RTX 5070 Ti →Amazon RTX 5070 Ti →

Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass Ihnen Mehrkosten entstehen. Als Amazon-Partner verdient QuelLLM an qualifizierten Käufen.

Artikel veröffentlicht und aktualisiert am von Mohamed Meguedmi · Quelle der Daten: /api/models.json · Lizenz für den Inhalt: CC BY 4.0.

Möchten Sie einen Fehler oder eine Aktualisierung melden? Mitwirken.