Mittelstufe 11 Min.Radeon RX 7000

Welches LLM auf einer Radeon RX 7800 XT (16 GB)? ?

Direkte Antwort

Die Radeon RX 7800 XT ist vor allem dank ihrer 16 GB VRAM und ihrer Bandbreite von 624 GB/s eine gute Wahl für lokale KI: Sie lädt Modelle mit 20 bis 24 Milliarden Parametern in Q4, was Karten mit 12 GB nicht können. Eine öffentlich zugängliche Messung mit Llama 2 7B in Q4_0 ergibt 118 Tokens pro Sekunde bei der Generierung unter Vulkan. Ihr Preis ist weniger entscheidend als die Kosten pro GB VRAM, die Sie auf /prix-gpu-ia vergleichen können.

Ob eine Grafikkarte ein gutes Angebot ist, hängt davon ab, ob das gewünschte Modell in ihren Speicher passt, nicht vom angegebenen Preis. Die RX 7800 XT ist eine der wenigen Karten mit 16 GB aus der RDNA-3-Generation, die bei ROCm und Ollama offiziell als unterstützt aufgeführt sind. Dieser Leitfaden zeigt, welche Modelle sie ausführt, wie schnell sie laut veröffentlichten Messungen ist und wie Sie ein Angebot bewerten können, ohne sich auf einen Preis zu verlassen, der sich jede Woche ändert.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Kaufalternative für diesen Guide: Radeon RX 9070 XT 16 GB.

Warum diese Wahl? Unsere vollständige Übersicht zu Radeon RX 9070 XT 16 GB →

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.

#Warum die RX 7800 XT eine preiswerte Wahl für ein lokales LLM ist

Die RX 7800 XT vereint drei Vorteile, die in dieser Leistungsklasse selten sind. Ihre 16 GB GDDR6 an einem 256-Bit-Bus bieten 624 GB/s Bandbreite – den Faktor, der die Generierungsgeschwindigkeit eines LLM begrenzt. AMD führt sie offiziell in ROCm auf (RDNA 3, Ziel gfx1101), und Ollama nennt sie sowohl für Linux als auch für Windows. Öffentliche Messungen zeigen zudem 118,27 Tokens pro Sekunde bei der Generierung mit einem 7B-Modell in Q4_0 unter Vulkan, also mehr als bei einer RX 7900 GRE in derselben Messreihe. Ihr Nachteil gegenüber NVIDIA liegt nicht in der Generierungsgeschwindigkeit, sondern beim Einlesen des Prompts, das dreimal so lange dauert wie bei einer RTX 4070 Ti Super.

Architektur
RDNA 3, Navi 32 in Chiplet-Technologie: ein GCD und vier MCD, veröffentlicht am 6. September 2023. Sie ist daher nicht monolithisch.
Berechnung
3.840 Stream-Prozessoren, 60 Recheneinheiten.
Speicher
16 GB GDDR6, 256-Bit-Bus, 624 GB/s.
Verbrauch
263 W Leistungsaufnahme der Karte.
Preis
Hier nicht festgelegt: siehe /prix-gpu-ia, wo jeden Montag und jeden Donnerstag der niedrigste Preis erfasst wird.

#Ein Angebot ohne festgelegten Preis beurteilen

Der Ausdruck „gutes Angebot“ setzt einen Preis voraus, und der Preis einer Grafikkarte ändert sich von Woche zu Woche. Statt einen Preis zu nennen, der in zehn Tagen nicht mehr stimmen würde, hier die Methode: Berechnen Sie die Kosten pro GB VRAM, indem Sie den Preis bei der 7800 XT durch 16 und bei einer Karte mit 12 GB durch 12 teilen. Die Preisübersicht der Website veröffentlicht diesen Wert für jede Karte. Stellen Sie sich dann die einzige Frage, die zählt: Ermöglicht die zusätzliche Kapazität die Nutzung eines Modells, das Sie wirklich verwenden möchten? Der Wechsel von 12 auf 16 GB ermöglicht Modelle mit 20 bis 24 Milliarden Parametern; der Wechsel von 16 auf 24 GB ermöglicht Modelle mit 30 Milliarden Parametern und mehr.

Anhaltspunkte zur Beurteilung eines Angebots (Rechenbeispiel, keine Preisangaben)
SituationErforderliche BerechnungFazit
Angebot für eine 7800 XTPreis ÷ 16 GBVergleichen Sie den Preis pro GB von GPUs mit 12 und 24 GB auf /prix-gpu-ia
Preisunterschied zu einer Karte mit 12 GBDifferenz ÷ 4 GB zusätzlicher SpeicherBei unterdurchschnittlichen Kosten pro GB ist die 16-GB-Karte ein guter Kauf
Unterschied zu einer RTX mit 16 GBWas CUDA für Sie wert istZahlen Sie dies nur dann, wenn ein Tool es erfordert oder wenn die Prompt-Lesung eine Rolle spielt
Gebrauchte KarteVor dem Kauf mit einem 12 bis 14 GB großen Modell testenOhne tatsächlichen Ladetest ablehnen

Ein Rechenbeispiel ohne konkrete Preisangabe: Wenn der Preisunterschied zwischen einer Karte mit 12 GB und der 7800 XT einem Betrag entspricht, den Sie ohnehin für ein 24B-Modell ausgegeben hätten, ist die Frage entschieden. Wenn Sie dagegen nur Modelle mit 8 bis 12 Milliarden Parametern verwenden, bringen Ihnen diese 4 GB nichts, und die RX 7700 XT oder die RX 6700 XT reichen aus.

#Was in 16 GB VRAM passt

Bei 16 GB können Sie etwa 15 GB für das Modell und seinen KV-Cache einplanen, wenn die Karte nicht für die Bildschirmausgabe zuständig ist. Der QuelLLM-Katalog nennt unten die Größe der Modellgewichte in Q4; der Speicherbedarf für den Kontext kommt hinzu, und bei großen Modellen wird der verbleibende Spielraum schnell zum begrenzenden Faktor.

Was auf eine 7800 XT passt (nur Modellgewichte)
ModellModellgrößePuffer für den KontextFazit
Gemma 4 12B in Q8≈ 13 GB≈ 2 GBPasst, kurzer Kontext
gpt-oss 20B in Q4≈ 13 GB≈ 2 GBPasst in den Speicher, kurzer bis mittlerer Kontext
Devstral Small 2 24B in Q4≈ 14 GB≈ 1 GBPasst nur knapp, sehr kurzer Kontext
Gemma 4 26B-A4B in Q4≈ 16 GBkeineZu knapp
Granite 4.1 30B in Q4≈ 17 GBkeinePasst nicht

Das Schlüsselwort in der Tabelle ist der Spielraum: Ein 24B-Modell in Q4 passt hinein, allerdings nur mit einem Kontext von wenigen Tausend Tokens. Für die Arbeit mit Code in langen Dateien setzt die Quantisierung des KV-Caches ein bis zwei Gigabyte frei, und eine Karte mit 20 GB wie die RX 7900 XT löst das Problem. Die Tabelle auf dieser Website zu Modellen für 16 GB erläutert die Kompromisse bei der Quantisierung unabhängig von der Grafikkartenmarke.

Ein Wort zu Mixture-of-Experts-Modellen (MoE) wie gpt-oss 20B: Nur ein Teil der Parameter ist bei jedem Token aktiv, was die Generierung beschleunigt, aber alle Gewichte müssen im Speicher liegen. Die Gesamtgröße entscheidet, ob das Modell in die 16 GB passt, nicht die Größe des aktiven Teils. Das erklärt, warum in der Tabelle oben ein 20B-MoE-Modell neben einem dichten 12B-Modell steht: Beide benötigen für ihre Gewichte etwa 13 GB Speicher.

#Gemessene Durchsatzraten: Vulkan oder ROCm

Die folgenden Zahlen sind keine Messungen dieser Website: Sie stammen aus zwei öffentlichen Diskussionen im llama.cpp-Repository, einer zu Vulkan und einer zu ROCm, in denen jeweils Llama 2 7B in Q4_0 mit llama-bench getestet wird. Die llama.cpp-Commits, Systeme und Treiber unterscheiden sich zwischen den Messreihen. Der Unterschied zwischen den beiden Reihen ist daher ein Anhaltspunkt, keine endgültige Rangliste.

RX 7800 XT mit Llama 2 7B Q4_0 (öffentlich zugängliche llama.cpp-Messungen)
BackendFlash AttentionLeseleistung pp512Generierung tg128
Vulkannein2 017,33 t/s118,27 t/s
Vulkanja2 197,05 t/s124,86 t/s
ROCmnein2 151,81 t/s100,94 t/s
ROCmja2 304,63 t/s95,99 t/s

Daraus ergeben sich zwei Erkenntnisse. Erstens generiert Vulkan in diesen Testreihen auf dieser Karte schneller als ROCm (118 gegenüber 101 Tokens pro Sekunde ohne Flash Attention), während ROCm den Prompt etwas schneller liest. Zweitens beschleunigt Flash Attention Vulkan, verlangsamt aber die Generierung unter ROCm leicht. Wenn Ihnen die Antwortgeschwindigkeit im Gespräch am wichtigsten ist, probieren Sie beide Backends mit Ihrem Modell aus, statt anzunehmen, dass ROCm gewinnt.

Der erreichte Anteil am theoretischen Maximum hilft, sich keine Sorgen zu machen: 624 GB/s geteilt durch 3,82 GB Modellgewichte ergeben 163 Tokens pro Sekunde; die Karte erreicht unter Vulkan 72 % davon. Auf größere Modelle übertragen liefert dieses Verhältnis Größenordnungen, die Sie auf Ihrem eigenen Rechner bestätigen sollten.

Schätzung von 72 % des Grenzwerts von 624 GB/s (Berechnung, nicht Messung)
Modell (Q4)ModellgrößeTheoretisches MaximumGrößenordnung
Llama 3.1 8B≈ 6 GB≈ 104 Tokens/s≈ 75 Tokens/s
Gemma 4 12B≈ 7 GB≈ 89 Tokens/s≈ 64 Tokens/s
Phi-4 14B≈ 9 GB≈ 69 Tokens/s≈ 50 Tokens/s
Devstral Small 2 24B≈ 14 GB≈ 45 Tokens/s≈ 32 Tokens/s

#Im Vergleich zu NVIDIA-Karten mit 16 GB: Die Prompt-Verarbeitung gibt den Ausschlag

Der Vergleich mit RTX-Karten mit 16 GB beruht auf zwei Messwerten. Bei der Generierung liegt die RX 7800 XT im selben Leistungsbereich wie die unter Vulkan gemessenen NVIDIA-Karten. Bei der Prompt-Verarbeitung ist der Unterschied sehr groß: Sie erreicht nur ein Drittel der Geschwindigkeit einer RTX 4070 Ti Super. Dieser zweite Wert fällt bei Anwendungen mit langen Dokumenten oder langen Gesprächsverläufen ins Gewicht, bei denen man auf das erste Wort wartet. Bei einem kurzen Chat oder einem Code-Assistenten mit überschaubarem Kontext spielt er kaum eine Rolle.

RX 7800 XT und RTX mit 16 GB unter Vulkan (Llama 2 7B Q4_0, ohne Flash Attention)
KarteVRAMLeseleistung pp512Generierung tg128
RX 7800 XT16 GB2 017,33 t/s118,27 t/s
RTX 4070 Ti Super16 GB6 099,18 t/s129,45 t/s
RTX 5070 Ti16 GB6 213,63 t/s135,63 t/s

#Ein 24B-Modell in 16 GB unterbringen: nützliche Ansätze

Ein Modell mit 24 Milliarden Parametern in Q4 benötigt etwa 14 GB Speicher, sodass kaum ein Gigabyte für den KV-Cache und das System übrig bleibt. Vier Maßnahmen verhindern eine teilweise Auslagerung auf die CPU, die die Geschwindigkeit einbrechen lassen würde. Die erste besteht darin, das Kontextfenster auf das tatsächlich benötigte Maß zu begrenzen, da der Cache mit jedem Token wächst. Die zweite ist die Quantisierung des KV-Caches, wodurch ein bis zwei Gigabyte frei werden. Die dritte besteht darin, Anwendungen zu schließen, die VRAM reservieren, etwa einen Browser mit Hardwarebeschleunigung oder ein Spiel. Die vierte ist, den Bildschirm an die integrierte Grafikeinheit des Prozessors anzuschließen, sofern diese vorhanden ist. Dadurch steht der AMD-Grafikkarte der zuvor für die Bildausgabe belegte Speicher wieder zur Verfügung.

Kontext
Passen Sie das Kontextfenster an den tatsächlichen Bedarf an: 4.000 bis 8.000 Tokens reichen für die meisten Gespräche.
KV-Cache
Quantisieren Sie ihn auf 8 Bit, um VRAM freizugeben, und behalten Sie dabei die Qualität bei Ihren Aufgaben im Blick.
Anzeige
Nutzen Sie den Videoausgang der integrierten Grafikkarte, sofern vorhanden.
Prüfung
Nach dem Laden muss ollama ps 100 % GPU anzeigen; jeder andere Anteil weist darauf hin, dass Teile des Modells in den Arbeitsspeicher ausgelagert werden.

Der Leitfaden zum Kontextfenster erklärt, warum ein langer Gesprächsverlauf auf kleinen Grafikkarten genauso viel Speicher verbraucht wie das Modell selbst.

#Erste Schritte

  1. 01
    Das System wählen
    Unter Linux unterstützt AMD die Radeon RX 7000 nur unter Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 und RHEL 9.7. Unter Windows setzt Ollama auf einen ROCm v7- oder HIP7-Stack.
  2. 02
    Ollama installieren
    Folgen Sie der Dokumentation von Ollama: Der ROCm-Treiber v7 ist unter Linux erforderlich. Vulkan ist standardmäßig aktiviert und dient als Ausweichlösung.
  3. 03
    Ein Modell laden, das passt
    Nehmen Sie ein 12B-Modell in Q8 oder ein 20B-Modell in Q4, bevor Sie ein 24B-Modell ausprobieren. Prüfen Sie mit ollama ps, ob es vollständig auf der GPU läuft.
  4. 04
    Vulkan und ROCm vergleichen
    Führen Sie llama-bench mit beiden Backends für Ihr Modell aus, jeweils mit und ohne Flash Attention, und wählen Sie das für Ihren Einsatzzweck schnellere Backend.
Terminal
ollama ps
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

#Fazit 2026

Eine gute Wahl, wenn
Sie möchten Modelle mit 20 bis 24 Milliarden Parametern nutzen und der Preis pro GB VRAM auf /prix-gpu-ia liegt unter dem vergleichbarer Karten mit 12 GB.
Kein guter Ansatz, wenn
Sie bleiben bei Modellen mit 8 bis 12 Milliarden Parametern: Eine Karte mit 12 GB reicht aus, und Sie bezahlen für ungenutzte Gigabyte.
Zu vermeiden
Der Kauf einer gebrauchten Karte, ohne zuvor das Laden eines 12 bis 14 GB großen Modells zu testen.

#Häufig gestellte Fragen

FAQ
RX 7800 XT: Ist sie eine gute Wahl für den Betrieb von LLMs?+
Ja, wenn Sie Modelle mit 20 bis 24 Milliarden Parametern nutzen möchten: Die 16 GB VRAM der Karte bieten dafür in Q4 genügend Platz, während Karten mit 12 GB daran scheitern. Beurteilen Sie das Angebot anhand der Kosten pro GB VRAM, die auf der Preisseite dieser Website veröffentlicht sind, statt allein anhand des angezeigten Preises.
Ist die RX 7800 XT im Jahr 2026 für LLMs geeignet?+
Laut einer öffentlichen Messung erzeugt sie mit einem 7B-Modell in Q4_0 unter Vulkan 118 Tokens pro Sekunde, und ihre 16 GB ermöglichen das Laden eines 24B-Modells in Q4. Ihr Schwachpunkt gegenüber NVIDIA ist die Verarbeitung des Prompts: Diese ist bei diesen Messungen etwa dreimal langsamer als bei einer RTX 4070 Ti Super.
Vulkan oder ROCm auf RX 7800 XT?+
In den beiden öffentlichen Diskussionen im llama.cpp-Repository generiert Vulkan schneller (118 gegenüber 101 Tokens pro Sekunde ohne Flash Attention), und ROCm liest den Prompt etwas schneller. Die Konfigurationen unterscheiden sich, daher testen Sie beide mit Ihrem Modell und wählen Sie das schnellere.
RX 7800 XT oder RX 7700 XT für lokale KI?+
Die 7800 XT bietet 4 GB mehr VRAM und ermöglicht damit die Nutzung von Modellen mit 20 bis 24 Milliarden Parametern. Ihre Bandbreite beträgt 624 GB/s gegenüber 432 GB/s. Wenn Sie bei Modellen mit 8 bis 14 Milliarden Parametern bleiben, reicht die 7700 XT aus; andernfalls ist der Preisunterschied in der Regel gerechtfertigt.
Welche Modelle passen auf eine RX 7800 XT mit 16 GB?+
Gemma 4 12B in Q8 und gpt-oss 20B in Q4 benötigen etwa 13 GB, Devstral Small 2 24B in Q4 etwa 14 GB, jeweils bei kurzem Kontext. Bei einem Modell mit 26 bis 30 Milliarden Parametern in Q4 benötigen allein die Gewichte mehr als 16 GB, sodass es nicht vollständig hineinpasst.
Wird die RX 7800 XT von Ollama unterstützt?+
Ja, laut der Ollama-Dokumentation sowohl unter Linux als auch unter Windows, unter Linux mit dem ROCm-v7-Treiber. AMD führt die Karte ebenfalls in ROCm auf, mit dem Ziel gfx1101, allerdings nur unter Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 oder RHEL 9.7. Vulkan ist in Ollama standardmäßig aktiviert und dient als Ausweichlösung.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.