Bester LLM auf Radeon RX 9070 XT (16 GB) im Jahr 2026
Identifizieren Sie den Bestes LLM für RX 9070 XT erfordert ein Verständnis zweier miteinander verknüpfter Einschränkungen: 16 GB GDDR6-VRAM und das ROCm-Ökosystem von AMD, das inzwischen auf der RDNA4-Architektur funktioniert. Die RX 9070 XT stellt 2026 den zugänglichsten Einstieg dar, um Modelle mit 27 Milliarden Parametern in Q4-Quantisierung auf Consumer-GPUs unter Linux oder Windows auszuführen. Dieser Leitfaden untersucht die Hardwarespezifikationen, wählt für diese Grafikkarte geeignete Modelle aus dem Katalog von WelchesLLM aus, vergleicht die Lizenzen, gibt Orientierung zur Geschwindigkeit und bietet Empfehlungen nach Anwendungsfall.
RX 9070 XT und ROCm: Was Sie vor der Auswahl eines Modells wissen sollten
Die Radeon RX 9070 XT verfügt über 16 GB GDDR6-Speicher auf einem 256-Bit-Bus und bietet eine theoretische Bandbreite von etwa 576 GB/s. Die Architektur RDNA4 wird seit ROCm 6.x, wodurch sich llama.cpp, kompiliert mit dem HIP-Backend, Ollama ≥ 0.3.x oder LM Studio nutzen lassen – vorausgesetzt, aktuelle amdgpu-Treiber unter Linux oder eine Installation von ROCm for Windows sind vorhanden.
Hauptpunkte vor dem Start eines Modells:
- nutzbarer VRAM : ~15,5 GB in der Praxis, nach Abzug des System- und Treiber-Overheads
- Bandbreite : ~576 GB/s (geschätzt), im Vergleich zu ~1.008 GB/s für eine RTX 4090 – die Inferenzgeschwindigkeit ist proportional reduziert
- Stabilstes Backend : llama.cpp mit
-DGGML_HIPBLAS=ONunter Linux - Kompatibilität : die AMD-Kompatibilitätsmatrix für Ihre genaue Kernel- und Treiberversion
- Native Präzision : FP16 unterstützt durch die RDNA4-Berechnungseinheiten
Die gute Nachricht: Modelle mit etwa 27B Parametern in Q4-Quantisierung sind für 16 GB bestens geeignet, und die 24B-Modellfamilie bietet einen komfortablen Spielraum für lange Kontexte.
Welche Modelle passen in 16 GB VRAM?
Als Faustregel gilt für Q4 ein Speicherbedarf von etwa 0,55 GB pro Milliarde Parameter. Ein 27B-Modell benötigt daher in Q4 etwa 15–16 GB, ein 24B-Modell etwa 13–14 GB und ein 32B-Modell etwa 18–19 GB – und überschreitet damit die Grenze.
26-27B-Modelle mit nativer Q4-Unterstützung (≤ 16 GB)
- Gemma 2 27B — VRAM Q4 : ~16 GB, ctx : 8 192
- Gemma 3 27B — VRAM Q4 : ~16 GB, ctx : 128 000
- Qwen 3.5 27B — VRAM Q4 : ~16 GB, ctx : 262 000
- Qwen 3.6 27B — VRAM Q4 : ~16 GB, ctx : 262 144
- Qwen 3.8 27B — VRAM Q4 : ~16 GB, ctx : 262 144
- Gemma 4 26B-A4B MoE — VRAM Q4 : ~16 GB, ctx : 128.000, Mixture-of-Experts-Architektur
- Trinity Mini 26B-A3B — VRAM Q4 : ~15 GB, ctx : 131 072
24B-Modelle (komfortabler Spielraum, 2–3 GB frei)
- Mistral Small 3.2 24B — VRAM Q4 : ~14 GB
- Magistral Small 24B — VRAM Q4 : ~14 GB
- Devstral Small 2 24B — VRAM Q4 : ~14 GB, ctx : 256 000
20–22B-Modelle (viel Spielraum, ~3–5 GB frei)
- Codestral 22B v0.1 — VRAM Q4 : ~13 GB, ctx : 32 000
- EuroLLM 22B Instruct 2512 — VRAM Q4 : ~13 GB, mehrsprachig mit europäischem Schwerpunkt
- gpt-oss 20B — VRAM Q4 : ~13 GB, ctx : 128 000
Hinweis zu den 32B : in Q4 (~19 GB) überschreiten sie die 16 GB, die verfügbar sind. In Q3 (~13–14 GB, also ~0,42 GB/B) ist es technisch möglich, jedoch mit messbaren Genauigkeitsverlusten. Auf der 9070 XT bleibt der Einsatz von 27B in Q4 der vernünftigste Ansatz.
Top 5 empfohlener Modelle für die RX 9070 XT
1. Qwen 3.8 27B — Vielseitigkeit und langer Kontext
Qwen 3.8 27B ist die fortschrittlichste Version der Qwen-3.x-Serie im 27B-Segment und wurde von Alibaba unter der Apache-2.0-Lizenz veröffentlicht. Das Kontextfenster von 262.144 Tokens gehört zu den größten in dieser Größenklasse. Das Modell belegt in Q4 die gesamten 16 GB, ohne in den Arbeitsspeicher ausgelagert zu werden.
- Lizenz : Apache 2.0 (kommerzielle Nutzung erlaubt)
- VRAM Q4 : ~16 GB
- Kontext : 262.144 Tokens
- Stärken : allgemeiner Überlegungen, Code, langfristige Fragen
- Geschätzte Geschwindigkeit : 20–30 Tok/s auf RX 9070 XT (geschätzt anhand von Community-Benchmarks, proportional zur Bandbreite)
2. Gemma 3 27B — bestätigte Leistung, Kontext 128 k
Gemma 3 27B von Google bietet ein Kontextfenster mit 128.000 Tokens und eine gut dokumentierte Architektur. Seine Leistungen auf dem Open LLM Leaderboard von Hugging Face machen es hinsichtlich Verständnis und Befolgung von Anweisungen zu einem der Referenzmodelle in der 27B-Kategorie.
- Lizenz : Gemma (Beschränkungen für bestimmte kommerzielle Anwendungen — siehe Allgemeine Geschäftsbedingungen von Google)
- VRAM Q4 : ~16 GB
- Kontext : 128 000 Tokens
- Stärken : Verständnis über große Kontextdistanzen hinweg, präzise Befolgung von Anweisungen
3. Magistral Small 24B — strukturiertes Denken
Magistral Small 24B von Mistral AI ist für mehrstufige Denkaufgaben und strukturierte Analysen konzipiert. Mit ~14 GB bei Q4 lässt es auf der 9070 XT 2 GB Spielraum — hilfreich, um im Produktivbetrieb einen erweiterten Systemkontext beizubehalten.
- Lizenz : Apache 2.0
- VRAM Q4 : ~14 GB
- Kontext : 128 000 Tokens
- Stärken : Analyse, strukturierte Zusammenfassung, Agent mit mehreren Arbeitsschritten, verkettetes Schlussfolgern
4. Devstral Small 2 24B — Softwareentwicklungs-Agent
Devstral Small 2 24B (Apache 2.0, Mistral AI) richtet sich explizit an Entwicklungsagenten mit einem außergewöhnlichen Kontext von 256.000 Tokens. Es kann eine gesamte Codebasis in einem Durchlauf verarbeiten, was es für automatisierte Codeüberprüfungen, Testgenerierung oder Dokumentation relevant macht.
- Lizenz : Apache 2.0
- VRAM Q4 : ~14 GB
- Kontext : 256.000 Tokens
- Stärken : Codegenerierung, Refactoring, Lesen großer Codebasen
5. Codestral 22B v0.1 — Spezialist für Code, leicht
Codestral 22B v0.1 von Mistral AI gehört zu den Referenzmodellen für Code mit weniger als 23 Milliarden Parametern. Es unterstützt Fill-in-the-Middle (FIM) und erzielt höhere HumanEval-Werte als Allzweckmodelle gleicher Größe (genaue Werte für GGUF Q4: noch zu bestätigen). Es benötigt in Q4 nur ~13 GB.
- Lizenz : Mistral Non-Production License (nur für nicht kommerzielle Nutzung)
- VRAM Q4 : ~13 GB
- Kontext : 32.000 Tokens
- Stärken : Code-Completion, FIM, IDE-Integration
Lizenzen: Apache 2.0, MIT, Gemma — was sich je nach Nutzung ändert
Die Auswahl der Lizenz bestimmt den Einsatz in Unternehmen oder in Produkten.
Freie Lizenzen für die kommerzielle Nutzung (Apache 2.0 oder MIT)
- Qwen 3.5 27B, Qwen 3.6 27B, Qwen 3.8 27B — Apache 2.0
- Trinity Mini 26B-A3B — Apache 2.0
- Magistral Small 24B, Devstral Small 2 24B, Mistral Small 3.2 24B — Apache 2.0
- EuroLLM 22B Instruct 2512, gpt-oss 20B — Apache 2.0
- Phi-4 14B — MIT
Eingeschränkte Lizenzen
- Gemma-Lizenz (Gemma 2 27B, Gemma 3 27B, Gemma 4 26B-A4B MoE): erfordert die Zustimmung zu den Nutzungsbedingungen von Google Gemma ; gewisse kommerzielle Anwendungen unterliegen Einschränkungen
- Mistral Non-Production License : Codestral 22B ist auf nicht kommerzielle und Forschungszwecke beschränkt
Für einen zusammenfassenden Überblick über die im Katalog verfügbaren Lizenzen siehe den Leitfaden zu den LLM-Lizenzen für Open-Weights.
Benchmarks und erwartete Leistung auf der RX 9070 XT
Die folgenden Werte stammen aus offiziellen Publikationen oder Community-Benchmarks. Die Inferenzgeschwindigkeiten auf der RX 9070 XT sind geschätzt auf der Grundlage von Messungen auf anderen GPUs, gewichtet nach der jeweiligen Speicherbandbreite.
MMLU — allgemeine Bewertung
- Qwen-3.x-27B-Serie: MMLU-Ergebnisse von über 75 % im 5-Shot-Verfahren laut der Qwen-Seite auf Hugging Face für die Varianten dieser Größe (bei Q4 noch zu bestätigen)
- Gemma 3 27B: von Google veröffentlichte Ergebnisse in der offizielle Gemma-Dokumentation — den Qualitätsverlust bei Q4 je nach Quantisierungsstufe prüfen
- Magistral Small 24B: von Mistral AI in den Versionshinweisen veröffentlichte Reasoning-Metriken
HumanEval — Codegenerierung
- Devstral Small 2 24B: für Coding-Agenten entwickelt, höherer HumanEval-Score als bei Allzweckmodellen derselben Größe (für GGUF Q4 noch zu bestätigen)
- Codestral 22B: Referenz in der Kategorie der Code-Modelle unter 23B laut den Community-Benchmarks auf r/LocalLLaMA
Schätzung der Inferenzgeschwindigkeit
- Modelle mit 27 Milliarden Parametern in Q4: 20–35 Token/s auf RX 9070 XT
- 24B-Modelle in Q4: 35–50 Tokens/s
- 14–22B-Modelle in Q4: 50-80 Tokens/s
Diese Bereiche hängen vom Backend (llama.cpp HIP vs. ROCm nativ), vom Parallelismusgrad und der Länge des aktiven Kontexts ab. Bei einem Kontext nahe dem Maximum (262 k Tokens) sinkt die Geschwindigkeit erheblich.
Konkrete Anwendungsfälle
Softwareentwicklung und Codeüberprüfung Devstral Small 2 24B für Agenten, die mit mehreren Dateien arbeiten, und große Projekte; Codestral 22B für Codevervollständigung und FIM in einer IDE. Beide laufen mit Spielraum auf der 9070 XT.
Analyse von langen Dokumenten Qwen 3.8 27B ermöglicht mit seinen 262.144 Kontexttokens die Analyse umfangreicher Verträge oder Berichte in einer einzigen Anfrage. Gemma 3 27B (128.000 Tokens) ist eine solide Alternative unter der Gemma-Lizenz.
Multilinguismus und Französisch EuroLLM 22B Instruct 2512 wurde speziell auf europäische Sprachen trainiert, darunter Französisch, Deutsch und Spanisch. Es läuft auf der 9070 XT mit etwa 3 GB Speicherreserve.
Schnelles und leichtes Modell Phi-4 14B (MIT, Microsoft) belegt in Q4 etwa 9 GB und lässt 7 GB für einen sehr großen Kontext oder gleichzeitige Sitzungen frei. Sinnvoll, wenn Geschwindigkeit wichtiger ist als die Modellgröße.
Reasoning und Agenten Magistral Small 24B für strukturierte Gedankengänge und einfache Agenten. Trinity Mini 26B-A3B (Apache 2.0, Arcee AI) bietet mit ~15 GB bei Q4 einen guten Kompromiss zwischen Schlussfolgerungsfähigkeit und Größe.
Um zwei Modelle direkt zu vergleichen, verwenden Sie den Vergleichsseite WelchesLLM.
FAQ
F: Wird die RX 9070 XT von ROCm gut unterstützt?
ROCm 6.x unterstützt die RDNA4-Architektur (navi48). Unter Linux mit neueren amdgpu-dkms-Treibern läuft llama.cpp HIP stabil. Unter Windows befindet sich ROCm for Windows noch im Reifungsprozess — die AMD-Kompatibilitätsmatrix bevor die Konfiguration beginnt. Die Leistung unter Linux ist derzeit in der Regel besser als in Windows-Umgebungen.
F: Kann ein 32B-Modell auf einer RX 9070 XT mit 16 GB laufen?
In Q4 (~19 GB für ein 32B-Modell) nein – die VRAM-Kapazität reicht nicht aus. In Q3 (~13–14 GB) ist es machbar, allerdings mit einem deutlichen Genauigkeitsverlust. In der Praxis bieten 27B-Modelle in Q4 auf dieser Karte ein besseres Verhältnis zwischen Qualität und Größe: gleiches Niveau bei der Inferenz, volle Q4-Präzision und ohne Risiko, die Speicherkapazität zu überschreiten.
F: Welche Quantisierung sollte zwischen Q4, Q5 und Q8 gewählt werden?
Q4_K_M ist der beste Ausgangspunkt: geringer Qualitätsverlust, halb so groß wie FP16. Q5_K_M verbessert die Genauigkeit bei etwa 25 % mehr VRAM. Q8_0 liegt nahe an FP16, benötigt bei den meisten 27B-Modellen aber mehr als 16 GB. Auf der 9070 XT sind Q4_K_M für 27B-Modelle oder Q5_K_M für 24B-Modelle sinnvolle Optionen. Vollständiges FP16 für 27B-Modelle (~30 GB) ist nicht möglich.
F: Funktioniert Ollama auf der RX 9070 XT unter Linux?
Ja. Ollama ≥ 0.3.x erkennt unter Linux automatisch ROCm-kompatible AMD-GPUs, sofern die amdgpu-dkms-Treiber korrekt installiert sind. In den meisten Fällen ist keine manuelle Konfiguration erforderlich. Unter Windows hängt die Unterstützung von der zum Zeitpunkt der Installation verfügbaren Version von ROCm for Windows ab.
Q: Welches Modell empfehlen Sie für den täglichen Französischgebrauch?
EuroLLM 22B Instruct 2512 ist am stärksten auf europäische Sprachen ausgerichtet. Mistral Small 3.2 24B von Mistral AI (Apache 2.0) bietet hervorragende Leistungen auf Französisch bei allgemeinen Aufgaben und beim unterstützten Schreiben, mit ausreichend Spielraum auf der 9070 XT.
Q: Qwen 3.8 27B oder Gemma 3 27B: Welchen wählen?
Die beiden benötigen jeweils ~16 GB in Q4. Qwen 3.8 27B ist unter der Apache 2.0-Lizenz (freier kommerzieller Gebrauch) und bietet einen größeren Kontext (262.144 vs. 128.000 Tokens). Gemma 3 27B unterliegt der Lizenz Gemma, die für kommerzielle Anwendungen strenger ist. Falls die Lizenz neutral ist, erfordern die entsprechenden Scores auf dem Open LLM Leaderboard ermöglichen eine Entscheidung anhand Ihrer konkreten Aufgabe.
Fazit
Le Bestes LLM für RX 9070 XT liegt 2026 im Bereich von 24-27B: Qwen 3.8 27B und Gemma 3 27B für allgemeine Vielseitigkeit, Devstral Small 2 24B und Codestral 22B für die Softwareentwicklung, EuroLLM 22B für europäische Mehrsprachigkeit, Magistral Small 24B für strukturiertes Schlussfolgern. Mit 16 GB VRAM, RDNA4 und ROCm ermöglicht diese Karte ein ernstzunehmendes Leistungsniveau beim Self-Hosting. Erkunden Sie den kompletter Katalog von WelchesLLM oder verwenden Sie den Konfigurator um Ihre Auswahl anhand Ihrer GPU, Ihrer gewünschten Lizenz und Ihres Anwendungsfalls zu verfeinern.
Das Hardware-Setup für die lokale Ausführung eines LLM
Um diese Modelle komfortabel lokal auszuführen, benötigt man Radeon RX 9070 XT bietet ein hervorragendes Preis-Leistungs-Verhältnis. Vergleichen Sie die Preise:
Affiliate-Links — WelchesLLM kann an Käufen eine Provision erhalten, ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.