Bester LLM auf Radeon RX 9070 XT (16 GB) im Jahr 2026

Identifizieren Sie den Bestes LLM für RX 9070 XT erfordert ein Verständnis zweier miteinander verknüpfter Einschränkungen: 16 GB GDDR6-VRAM und das ROCm-Ökosystem von AMD, das inzwischen auf der RDNA4-Architektur funktioniert. Die RX 9070 XT stellt 2026 den zugänglichsten Einstieg dar, um Modelle mit 27 Milliarden Parametern in Q4-Quantisierung auf Consumer-GPUs unter Linux oder Windows auszuführen. Dieser Leitfaden untersucht die Hardwarespezifikationen, wählt für diese Grafikkarte geeignete Modelle aus dem Katalog von WelchesLLM aus, vergleicht die Lizenzen, gibt Orientierung zur Geschwindigkeit und bietet Empfehlungen nach Anwendungsfall.


RX 9070 XT und ROCm: Was Sie vor der Auswahl eines Modells wissen sollten

Die Radeon RX 9070 XT verfügt über 16 GB GDDR6-Speicher auf einem 256-Bit-Bus und bietet eine theoretische Bandbreite von etwa 576 GB/s. Die Architektur RDNA4 wird seit ROCm 6.x, wodurch sich llama.cpp, kompiliert mit dem HIP-Backend, Ollama ≥ 0.3.x oder LM Studio nutzen lassen – vorausgesetzt, aktuelle amdgpu-Treiber unter Linux oder eine Installation von ROCm for Windows sind vorhanden.

Hauptpunkte vor dem Start eines Modells:

Die gute Nachricht: Modelle mit etwa 27B Parametern in Q4-Quantisierung sind für 16 GB bestens geeignet, und die 24B-Modellfamilie bietet einen komfortablen Spielraum für lange Kontexte.


Welche Modelle passen in 16 GB VRAM?

Als Faustregel gilt für Q4 ein Speicherbedarf von etwa 0,55 GB pro Milliarde Parameter. Ein 27B-Modell benötigt daher in Q4 etwa 15–16 GB, ein 24B-Modell etwa 13–14 GB und ein 32B-Modell etwa 18–19 GB – und überschreitet damit die Grenze.

26-27B-Modelle mit nativer Q4-Unterstützung (≤ 16 GB)

24B-Modelle (komfortabler Spielraum, 2–3 GB frei)

20–22B-Modelle (viel Spielraum, ~3–5 GB frei)

Hinweis zu den 32B : in Q4 (~19 GB) überschreiten sie die 16 GB, die verfügbar sind. In Q3 (~13–14 GB, also ~0,42 GB/B) ist es technisch möglich, jedoch mit messbaren Genauigkeitsverlusten. Auf der 9070 XT bleibt der Einsatz von 27B in Q4 der vernünftigste Ansatz.


Top 5 empfohlener Modelle für die RX 9070 XT

1. Qwen 3.8 27B — Vielseitigkeit und langer Kontext

Qwen 3.8 27B ist die fortschrittlichste Version der Qwen-3.x-Serie im 27B-Segment und wurde von Alibaba unter der Apache-2.0-Lizenz veröffentlicht. Das Kontextfenster von 262.144 Tokens gehört zu den größten in dieser Größenklasse. Das Modell belegt in Q4 die gesamten 16 GB, ohne in den Arbeitsspeicher ausgelagert zu werden.

2. Gemma 3 27B — bestätigte Leistung, Kontext 128 k

Gemma 3 27B von Google bietet ein Kontextfenster mit 128.000 Tokens und eine gut dokumentierte Architektur. Seine Leistungen auf dem Open LLM Leaderboard von Hugging Face machen es hinsichtlich Verständnis und Befolgung von Anweisungen zu einem der Referenzmodelle in der 27B-Kategorie.

3. Magistral Small 24B — strukturiertes Denken

Magistral Small 24B von Mistral AI ist für mehrstufige Denkaufgaben und strukturierte Analysen konzipiert. Mit ~14 GB bei Q4 lässt es auf der 9070 XT 2 GB Spielraum — hilfreich, um im Produktivbetrieb einen erweiterten Systemkontext beizubehalten.

4. Devstral Small 2 24B — Softwareentwicklungs-Agent

Devstral Small 2 24B (Apache 2.0, Mistral AI) richtet sich explizit an Entwicklungsagenten mit einem außergewöhnlichen Kontext von 256.000 Tokens. Es kann eine gesamte Codebasis in einem Durchlauf verarbeiten, was es für automatisierte Codeüberprüfungen, Testgenerierung oder Dokumentation relevant macht.

5. Codestral 22B v0.1 — Spezialist für Code, leicht

Codestral 22B v0.1 von Mistral AI gehört zu den Referenzmodellen für Code mit weniger als 23 Milliarden Parametern. Es unterstützt Fill-in-the-Middle (FIM) und erzielt höhere HumanEval-Werte als Allzweckmodelle gleicher Größe (genaue Werte für GGUF Q4: noch zu bestätigen). Es benötigt in Q4 nur ~13 GB.


Lizenzen: Apache 2.0, MIT, Gemma — was sich je nach Nutzung ändert

Die Auswahl der Lizenz bestimmt den Einsatz in Unternehmen oder in Produkten.

Freie Lizenzen für die kommerzielle Nutzung (Apache 2.0 oder MIT)

Eingeschränkte Lizenzen

Für einen zusammenfassenden Überblick über die im Katalog verfügbaren Lizenzen siehe den Leitfaden zu den LLM-Lizenzen für Open-Weights.


Benchmarks und erwartete Leistung auf der RX 9070 XT

Die folgenden Werte stammen aus offiziellen Publikationen oder Community-Benchmarks. Die Inferenzgeschwindigkeiten auf der RX 9070 XT sind geschätzt auf der Grundlage von Messungen auf anderen GPUs, gewichtet nach der jeweiligen Speicherbandbreite.

MMLU — allgemeine Bewertung

HumanEval — Codegenerierung

Schätzung der Inferenzgeschwindigkeit

Diese Bereiche hängen vom Backend (llama.cpp HIP vs. ROCm nativ), vom Parallelismusgrad und der Länge des aktiven Kontexts ab. Bei einem Kontext nahe dem Maximum (262 k Tokens) sinkt die Geschwindigkeit erheblich.


Konkrete Anwendungsfälle

Softwareentwicklung und Codeüberprüfung Devstral Small 2 24B für Agenten, die mit mehreren Dateien arbeiten, und große Projekte; Codestral 22B für Codevervollständigung und FIM in einer IDE. Beide laufen mit Spielraum auf der 9070 XT.

Analyse von langen Dokumenten Qwen 3.8 27B ermöglicht mit seinen 262.144 Kontexttokens die Analyse umfangreicher Verträge oder Berichte in einer einzigen Anfrage. Gemma 3 27B (128.000 Tokens) ist eine solide Alternative unter der Gemma-Lizenz.

Multilinguismus und Französisch EuroLLM 22B Instruct 2512 wurde speziell auf europäische Sprachen trainiert, darunter Französisch, Deutsch und Spanisch. Es läuft auf der 9070 XT mit etwa 3 GB Speicherreserve.

Schnelles und leichtes Modell Phi-4 14B (MIT, Microsoft) belegt in Q4 etwa 9 GB und lässt 7 GB für einen sehr großen Kontext oder gleichzeitige Sitzungen frei. Sinnvoll, wenn Geschwindigkeit wichtiger ist als die Modellgröße.

Reasoning und Agenten Magistral Small 24B für strukturierte Gedankengänge und einfache Agenten. Trinity Mini 26B-A3B (Apache 2.0, Arcee AI) bietet mit ~15 GB bei Q4 einen guten Kompromiss zwischen Schlussfolgerungsfähigkeit und Größe.

Um zwei Modelle direkt zu vergleichen, verwenden Sie den Vergleichsseite WelchesLLM.


FAQ

F: Wird die RX 9070 XT von ROCm gut unterstützt?

ROCm 6.x unterstützt die RDNA4-Architektur (navi48). Unter Linux mit neueren amdgpu-dkms-Treibern läuft llama.cpp HIP stabil. Unter Windows befindet sich ROCm for Windows noch im Reifungsprozess — die AMD-Kompatibilitätsmatrix bevor die Konfiguration beginnt. Die Leistung unter Linux ist derzeit in der Regel besser als in Windows-Umgebungen.

F: Kann ein 32B-Modell auf einer RX 9070 XT mit 16 GB laufen?

In Q4 (~19 GB für ein 32B-Modell) nein – die VRAM-Kapazität reicht nicht aus. In Q3 (~13–14 GB) ist es machbar, allerdings mit einem deutlichen Genauigkeitsverlust. In der Praxis bieten 27B-Modelle in Q4 auf dieser Karte ein besseres Verhältnis zwischen Qualität und Größe: gleiches Niveau bei der Inferenz, volle Q4-Präzision und ohne Risiko, die Speicherkapazität zu überschreiten.

F: Welche Quantisierung sollte zwischen Q4, Q5 und Q8 gewählt werden?

Q4_K_M ist der beste Ausgangspunkt: geringer Qualitätsverlust, halb so groß wie FP16. Q5_K_M verbessert die Genauigkeit bei etwa 25 % mehr VRAM. Q8_0 liegt nahe an FP16, benötigt bei den meisten 27B-Modellen aber mehr als 16 GB. Auf der 9070 XT sind Q4_K_M für 27B-Modelle oder Q5_K_M für 24B-Modelle sinnvolle Optionen. Vollständiges FP16 für 27B-Modelle (~30 GB) ist nicht möglich.

F: Funktioniert Ollama auf der RX 9070 XT unter Linux?

Ja. Ollama ≥ 0.3.x erkennt unter Linux automatisch ROCm-kompatible AMD-GPUs, sofern die amdgpu-dkms-Treiber korrekt installiert sind. In den meisten Fällen ist keine manuelle Konfiguration erforderlich. Unter Windows hängt die Unterstützung von der zum Zeitpunkt der Installation verfügbaren Version von ROCm for Windows ab.

Q: Welches Modell empfehlen Sie für den täglichen Französischgebrauch?

EuroLLM 22B Instruct 2512 ist am stärksten auf europäische Sprachen ausgerichtet. Mistral Small 3.2 24B von Mistral AI (Apache 2.0) bietet hervorragende Leistungen auf Französisch bei allgemeinen Aufgaben und beim unterstützten Schreiben, mit ausreichend Spielraum auf der 9070 XT.

Q: Qwen 3.8 27B oder Gemma 3 27B: Welchen wählen?

Die beiden benötigen jeweils ~16 GB in Q4. Qwen 3.8 27B ist unter der Apache 2.0-Lizenz (freier kommerzieller Gebrauch) und bietet einen größeren Kontext (262.144 vs. 128.000 Tokens). Gemma 3 27B unterliegt der Lizenz Gemma, die für kommerzielle Anwendungen strenger ist. Falls die Lizenz neutral ist, erfordern die entsprechenden Scores auf dem Open LLM Leaderboard ermöglichen eine Entscheidung anhand Ihrer konkreten Aufgabe.


Fazit

Le Bestes LLM für RX 9070 XT liegt 2026 im Bereich von 24-27B: Qwen 3.8 27B und Gemma 3 27B für allgemeine Vielseitigkeit, Devstral Small 2 24B und Codestral 22B für die Softwareentwicklung, EuroLLM 22B für europäische Mehrsprachigkeit, Magistral Small 24B für strukturiertes Schlussfolgern. Mit 16 GB VRAM, RDNA4 und ROCm ermöglicht diese Karte ein ernstzunehmendes Leistungsniveau beim Self-Hosting. Erkunden Sie den kompletter Katalog von WelchesLLM oder verwenden Sie den Konfigurator um Ihre Auswahl anhand Ihrer GPU, Ihrer gewünschten Lizenz und Ihres Anwendungsfalls zu verfeinern.

Das Hardware-Setup für die lokale Ausführung eines LLM

Um diese Modelle komfortabel lokal auszuführen, benötigt man Radeon RX 9070 XT bietet ein hervorragendes Preis-Leistungs-Verhältnis. Vergleichen Sie die Preise:

Amazon Radeon RX 9070 XT →

Affiliate-Links — WelchesLLM kann an Käufen eine Provision erhalten, ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.

Artikel veröffentlicht und aktualisiert am von Mohamed Meguedmi · Quelle der Daten: /api/models.json · Lizenz für den Inhalt: CC BY 4.0.

Möchten Sie einen Fehler oder eine Aktualisierung melden? Mitwirken.