Welches LLM auf einer Radeon RX 7800 XT (16 GB)? ?
Die Radeon RX 7800 XT ist vor allem dank ihrer 16 GB VRAM und ihrer Bandbreite von 624 GB/s eine gute Wahl für lokale KI: Sie lädt Modelle mit 20 bis 24 Milliarden Parametern in Q4, was Karten mit 12 GB nicht können. Eine öffentlich zugängliche Messung mit Llama 2 7B in Q4_0 ergibt 118 Tokens pro Sekunde bei der Generierung unter Vulkan. Ihr Preis ist weniger entscheidend als die Kosten pro GB VRAM, die Sie auf /prix-gpu-ia vergleichen können.
Ob eine Grafikkarte ein gutes Angebot ist, hängt davon ab, ob das gewünschte Modell in ihren Speicher passt, nicht vom angegebenen Preis. Die RX 7800 XT ist eine der wenigen Karten mit 16 GB aus der RDNA-3-Generation, die bei ROCm und Ollama offiziell als unterstützt aufgeführt sind. Dieser Leitfaden zeigt, welche Modelle sie ausführt, wie schnell sie laut veröffentlichten Messungen ist und wie Sie ein Angebot bewerten können, ohne sich auf einen Preis zu verlassen, der sich jede Woche ändert.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: Radeon RX 9070 XT 16 GB.
Warum diese Wahl? Unsere vollständige Übersicht zu Radeon RX 9070 XT 16 GB →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.
#Warum die RX 7800 XT eine preiswerte Wahl für ein lokales LLM ist
Die RX 7800 XT vereint drei Vorteile, die in dieser Leistungsklasse selten sind. Ihre 16 GB GDDR6 an einem 256-Bit-Bus bieten 624 GB/s Bandbreite – den Faktor, der die Generierungsgeschwindigkeit eines LLM begrenzt. AMD führt sie offiziell in ROCm auf (RDNA 3, Ziel gfx1101), und Ollama nennt sie sowohl für Linux als auch für Windows. Öffentliche Messungen zeigen zudem 118,27 Tokens pro Sekunde bei der Generierung mit einem 7B-Modell in Q4_0 unter Vulkan, also mehr als bei einer RX 7900 GRE in derselben Messreihe. Ihr Nachteil gegenüber NVIDIA liegt nicht in der Generierungsgeschwindigkeit, sondern beim Einlesen des Prompts, das dreimal so lange dauert wie bei einer RTX 4070 Ti Super.
- Architektur
- RDNA 3, Navi 32 in Chiplet-Technologie: ein GCD und vier MCD, veröffentlicht am 6. September 2023. Sie ist daher nicht monolithisch.
- Berechnung
- 3.840 Stream-Prozessoren, 60 Recheneinheiten.
- Speicher
- 16 GB GDDR6, 256-Bit-Bus, 624 GB/s.
- Verbrauch
- 263 W Leistungsaufnahme der Karte.
- Preis
- Hier nicht festgelegt: siehe /prix-gpu-ia, wo jeden Montag und jeden Donnerstag der niedrigste Preis erfasst wird.
#Ein Angebot ohne festgelegten Preis beurteilen
Der Ausdruck „gutes Angebot“ setzt einen Preis voraus, und der Preis einer Grafikkarte ändert sich von Woche zu Woche. Statt einen Preis zu nennen, der in zehn Tagen nicht mehr stimmen würde, hier die Methode: Berechnen Sie die Kosten pro GB VRAM, indem Sie den Preis bei der 7800 XT durch 16 und bei einer Karte mit 12 GB durch 12 teilen. Die Preisübersicht der Website veröffentlicht diesen Wert für jede Karte. Stellen Sie sich dann die einzige Frage, die zählt: Ermöglicht die zusätzliche Kapazität die Nutzung eines Modells, das Sie wirklich verwenden möchten? Der Wechsel von 12 auf 16 GB ermöglicht Modelle mit 20 bis 24 Milliarden Parametern; der Wechsel von 16 auf 24 GB ermöglicht Modelle mit 30 Milliarden Parametern und mehr.
| Situation | Erforderliche Berechnung | Fazit |
|---|---|---|
| Angebot für eine 7800 XT | Preis ÷ 16 GB | Vergleichen Sie den Preis pro GB von GPUs mit 12 und 24 GB auf /prix-gpu-ia |
| Preisunterschied zu einer Karte mit 12 GB | Differenz ÷ 4 GB zusätzlicher Speicher | Bei unterdurchschnittlichen Kosten pro GB ist die 16-GB-Karte ein guter Kauf |
| Unterschied zu einer RTX mit 16 GB | Was CUDA für Sie wert ist | Zahlen Sie dies nur dann, wenn ein Tool es erfordert oder wenn die Prompt-Lesung eine Rolle spielt |
| Gebrauchte Karte | Vor dem Kauf mit einem 12 bis 14 GB großen Modell testen | Ohne tatsächlichen Ladetest ablehnen |
Ein Rechenbeispiel ohne konkrete Preisangabe: Wenn der Preisunterschied zwischen einer Karte mit 12 GB und der 7800 XT einem Betrag entspricht, den Sie ohnehin für ein 24B-Modell ausgegeben hätten, ist die Frage entschieden. Wenn Sie dagegen nur Modelle mit 8 bis 12 Milliarden Parametern verwenden, bringen Ihnen diese 4 GB nichts, und die RX 7700 XT oder die RX 6700 XT reichen aus.
- Preise für Grafikkarten für lokale KI, zweimal wöchentlich erfasst
- Welches LLM eignet sich für 16 GB VRAM – unabhängig von der Grafikkarte?
#Was in 16 GB VRAM passt
Bei 16 GB können Sie etwa 15 GB für das Modell und seinen KV-Cache einplanen, wenn die Karte nicht für die Bildschirmausgabe zuständig ist. Der QuelLLM-Katalog nennt unten die Größe der Modellgewichte in Q4; der Speicherbedarf für den Kontext kommt hinzu, und bei großen Modellen wird der verbleibende Spielraum schnell zum begrenzenden Faktor.
| Modell | Modellgröße | Puffer für den Kontext | Fazit |
|---|---|---|---|
| Gemma 4 12B in Q8 | ≈ 13 GB | ≈ 2 GB | Passt, kurzer Kontext |
| gpt-oss 20B in Q4 | ≈ 13 GB | ≈ 2 GB | Passt in den Speicher, kurzer bis mittlerer Kontext |
| Devstral Small 2 24B in Q4 | ≈ 14 GB | ≈ 1 GB | Passt nur knapp, sehr kurzer Kontext |
| Gemma 4 26B-A4B in Q4 | ≈ 16 GB | keine | Zu knapp |
| Granite 4.1 30B in Q4 | ≈ 17 GB | keine | Passt nicht |
Das Schlüsselwort in der Tabelle ist der Spielraum: Ein 24B-Modell in Q4 passt hinein, allerdings nur mit einem Kontext von wenigen Tausend Tokens. Für die Arbeit mit Code in langen Dateien setzt die Quantisierung des KV-Caches ein bis zwei Gigabyte frei, und eine Karte mit 20 GB wie die RX 7900 XT löst das Problem. Die Tabelle auf dieser Website zu Modellen für 16 GB erläutert die Kompromisse bei der Quantisierung unabhängig von der Grafikkartenmarke.
Ein Wort zu Mixture-of-Experts-Modellen (MoE) wie gpt-oss 20B: Nur ein Teil der Parameter ist bei jedem Token aktiv, was die Generierung beschleunigt, aber alle Gewichte müssen im Speicher liegen. Die Gesamtgröße entscheidet, ob das Modell in die 16 GB passt, nicht die Größe des aktiven Teils. Das erklärt, warum in der Tabelle oben ein 20B-MoE-Modell neben einem dichten 12B-Modell steht: Beide benötigen für ihre Gewichte etwa 13 GB Speicher.
#Gemessene Durchsatzraten: Vulkan oder ROCm
Die folgenden Zahlen sind keine Messungen dieser Website: Sie stammen aus zwei öffentlichen Diskussionen im llama.cpp-Repository, einer zu Vulkan und einer zu ROCm, in denen jeweils Llama 2 7B in Q4_0 mit llama-bench getestet wird. Die llama.cpp-Commits, Systeme und Treiber unterscheiden sich zwischen den Messreihen. Der Unterschied zwischen den beiden Reihen ist daher ein Anhaltspunkt, keine endgültige Rangliste.
| Backend | Flash Attention | Leseleistung pp512 | Generierung tg128 |
|---|---|---|---|
| Vulkan | nein | 2 017,33 t/s | 118,27 t/s |
| Vulkan | ja | 2 197,05 t/s | 124,86 t/s |
| ROCm | nein | 2 151,81 t/s | 100,94 t/s |
| ROCm | ja | 2 304,63 t/s | 95,99 t/s |
Daraus ergeben sich zwei Erkenntnisse. Erstens generiert Vulkan in diesen Testreihen auf dieser Karte schneller als ROCm (118 gegenüber 101 Tokens pro Sekunde ohne Flash Attention), während ROCm den Prompt etwas schneller liest. Zweitens beschleunigt Flash Attention Vulkan, verlangsamt aber die Generierung unter ROCm leicht. Wenn Ihnen die Antwortgeschwindigkeit im Gespräch am wichtigsten ist, probieren Sie beide Backends mit Ihrem Modell aus, statt anzunehmen, dass ROCm gewinnt.
Der erreichte Anteil am theoretischen Maximum hilft, sich keine Sorgen zu machen: 624 GB/s geteilt durch 3,82 GB Modellgewichte ergeben 163 Tokens pro Sekunde; die Karte erreicht unter Vulkan 72 % davon. Auf größere Modelle übertragen liefert dieses Verhältnis Größenordnungen, die Sie auf Ihrem eigenen Rechner bestätigen sollten.
| Modell (Q4) | Modellgröße | Theoretisches Maximum | Größenordnung |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 104 Tokens/s | ≈ 75 Tokens/s |
| Gemma 4 12B | ≈ 7 GB | ≈ 89 Tokens/s | ≈ 64 Tokens/s |
| Phi-4 14B | ≈ 9 GB | ≈ 69 Tokens/s | ≈ 50 Tokens/s |
| Devstral Small 2 24B | ≈ 14 GB | ≈ 45 Tokens/s | ≈ 32 Tokens/s |
#Im Vergleich zu NVIDIA-Karten mit 16 GB: Die Prompt-Verarbeitung gibt den Ausschlag
Der Vergleich mit RTX-Karten mit 16 GB beruht auf zwei Messwerten. Bei der Generierung liegt die RX 7800 XT im selben Leistungsbereich wie die unter Vulkan gemessenen NVIDIA-Karten. Bei der Prompt-Verarbeitung ist der Unterschied sehr groß: Sie erreicht nur ein Drittel der Geschwindigkeit einer RTX 4070 Ti Super. Dieser zweite Wert fällt bei Anwendungen mit langen Dokumenten oder langen Gesprächsverläufen ins Gewicht, bei denen man auf das erste Wort wartet. Bei einem kurzen Chat oder einem Code-Assistenten mit überschaubarem Kontext spielt er kaum eine Rolle.
| Karte | VRAM | Leseleistung pp512 | Generierung tg128 |
|---|---|---|---|
| RX 7800 XT | 16 GB | 2 017,33 t/s | 118,27 t/s |
| RTX 4070 Ti Super | 16 GB | 6 099,18 t/s | 129,45 t/s |
| RTX 5070 Ti | 16 GB | 6 213,63 t/s | 135,63 t/s |
- RTX 4070 Ti Super, die NVIDIA-Alternative mit 16 GB
- Radeon RX 7900 GRE, eine weitere Karte der gleichen Generation mit 16 GB
#Ein 24B-Modell in 16 GB unterbringen: nützliche Ansätze
Ein Modell mit 24 Milliarden Parametern in Q4 benötigt etwa 14 GB Speicher, sodass kaum ein Gigabyte für den KV-Cache und das System übrig bleibt. Vier Maßnahmen verhindern eine teilweise Auslagerung auf die CPU, die die Geschwindigkeit einbrechen lassen würde. Die erste besteht darin, das Kontextfenster auf das tatsächlich benötigte Maß zu begrenzen, da der Cache mit jedem Token wächst. Die zweite ist die Quantisierung des KV-Caches, wodurch ein bis zwei Gigabyte frei werden. Die dritte besteht darin, Anwendungen zu schließen, die VRAM reservieren, etwa einen Browser mit Hardwarebeschleunigung oder ein Spiel. Die vierte ist, den Bildschirm an die integrierte Grafikeinheit des Prozessors anzuschließen, sofern diese vorhanden ist. Dadurch steht der AMD-Grafikkarte der zuvor für die Bildausgabe belegte Speicher wieder zur Verfügung.
- Kontext
- Passen Sie das Kontextfenster an den tatsächlichen Bedarf an: 4.000 bis 8.000 Tokens reichen für die meisten Gespräche.
- KV-Cache
- Quantisieren Sie ihn auf 8 Bit, um VRAM freizugeben, und behalten Sie dabei die Qualität bei Ihren Aufgaben im Blick.
- Anzeige
- Nutzen Sie den Videoausgang der integrierten Grafikkarte, sofern vorhanden.
- Prüfung
- Nach dem Laden muss ollama ps 100 % GPU anzeigen; jeder andere Anteil weist darauf hin, dass Teile des Modells in den Arbeitsspeicher ausgelagert werden.
Der Leitfaden zum Kontextfenster erklärt, warum ein langer Gesprächsverlauf auf kleinen Grafikkarten genauso viel Speicher verbraucht wie das Modell selbst.
#Erste Schritte
- 01Das System wählenUnter Linux unterstützt AMD die Radeon RX 7000 nur unter Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 und RHEL 9.7. Unter Windows setzt Ollama auf einen ROCm v7- oder HIP7-Stack.
- 02Ollama installierenFolgen Sie der Dokumentation von Ollama: Der ROCm-Treiber v7 ist unter Linux erforderlich. Vulkan ist standardmäßig aktiviert und dient als Ausweichlösung.
- 03Ein Modell laden, das passtNehmen Sie ein 12B-Modell in Q8 oder ein 20B-Modell in Q4, bevor Sie ein 24B-Modell ausprobieren. Prüfen Sie mit ollama ps, ob es vollständig auf der GPU läuft.
- 04Vulkan und ROCm vergleichenFühren Sie llama-bench mit beiden Backends für Ihr Modell aus, jeweils mit und ohne Flash Attention, und wählen Sie das für Ihren Einsatzzweck schnellere Backend.
#Fazit 2026
- Eine gute Wahl, wenn
- Sie möchten Modelle mit 20 bis 24 Milliarden Parametern nutzen und der Preis pro GB VRAM auf /prix-gpu-ia liegt unter dem vergleichbarer Karten mit 12 GB.
- Kein guter Ansatz, wenn
- Sie bleiben bei Modellen mit 8 bis 12 Milliarden Parametern: Eine Karte mit 12 GB reicht aus, und Sie bezahlen für ungenutzte Gigabyte.
- Zu vermeiden
- Der Kauf einer gebrauchten Karte, ohne zuvor das Laden eines 12 bis 14 GB großen Modells zu testen.
- Ollama-Dokumentation: Unterstützte AMD-Grafikkarten
- ROCm-GPU-Kompatibilität, AMD-Dokumentation
- Vulkan-Scoreboard im llama.cpp-Repository
- ROCm-Scoreboard des Repositorys llama.cpp
#Häufig gestellte Fragen
RX 7800 XT: Ist sie eine gute Wahl für den Betrieb von LLMs?+
Ist die RX 7800 XT im Jahr 2026 für LLMs geeignet?+
Vulkan oder ROCm auf RX 7800 XT?+
RX 7800 XT oder RX 7700 XT für lokale KI?+
Welche Modelle passen auf eine RX 7800 XT mit 16 GB?+
Wird die RX 7800 XT von Ollama unterstützt?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.