Welches LLM auf Radeon RX 7700 XT (12 GB) ?
Die Radeon RX 7700 XT (12 GB GDDR6, 432 GB/s) wird offiziell von ROCm und Ollama unterstützt, sowohl unter Linux als auch unter Windows. Sie kann Modelle mit 8 bis 14 Milliarden Parametern in Q4 ohne Kompromisse ausführen, reicht aber nicht für Modelle mit 20 bis 24 Milliarden Parametern aus, die 13 bis 14 GB benötigen. Auf den llama.cpp-Scoreboards sind für sie keine Durchsatzwerte veröffentlicht: Ihre Leistung liegt zwischen der einer RX 6700 XT und der einer RX 7800 XT.
Der Wert der RX 7700 XT liegt vor allem darin, was ihre 12 GB ermöglichen, und in ihrer Position innerhalb der Produktreihe: schneller und besser unterstützt als die vorherige Generation, aber unterhalb der 16-GB-Schwelle, die Modelle mit 20 bis 24 Milliarden Parametern ermöglicht. Hier finden Sie eine Entscheidungsgrundlage dafür, ob sie ausreicht – mit Messwerten samt Quellenangaben und klar gekennzeichneten Schätzungen.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: Radeon RX 9070 XT 16 GB.
Warum diese Wahl? Unsere vollständige Übersicht zu Radeon RX 9070 XT 16 GB →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#Was die RX 7700 XT im Jahr 2026 leistet
Eine RX 7700 XT eignet sich für ein mittelgroßes lokales LLM: Ihre 12 GB bieten Platz für Llama 3.1 8B, Gemma 4 12B oder Phi-4 14B in Q4 und lassen noch Raum für den Kontext. Ihre Bandbreite von 432 GB/s liegt 12,5 % über der einer RX 6700 XT und bestimmt die Obergrenze der Generierungsgeschwindigkeit: etwa 113 Tokens pro Sekunde beim 7B-Referenzmodell der Scoreboards, gegenüber 163 bei einer RX 7800 XT. Sie hat einen klaren Vorteil gegenüber der 6700 XT: ROCm und Ollama führen sie offiziell auf, auch für Windows. Ihr Nachteil ist die Speicherkapazität, die sie für Modelle mit 20 bis 24 Milliarden Parametern ungeeignet macht; hier werden die 16 GB der 7800 XT wertvoll.
- Architektur
- RDNA 3, Navi-32-Chip aus Chiplets (1 GCD und 3 MCD), am 6. September 2023 auf den Markt gebracht.
- Berechnung
- 3.456 Stream-Prozessoren, 54 Recheneinheiten.
- Speicher
- 12 GB GDDR6, 192-Bit-Bus, 432 GB/s.
- Verbrauch
- 245 W Leistungsaufnahme der Karte.
- Preis
- Hier nicht angegeben: Unter /prix-gpu-ia finden Sie den niedrigsten Preis, der jede Woche erfasst wird.
#ROCm, Ollama und Windows: offizielle Unterstützung
Das ist der Punkt, der sie von der vorherigen Generation unterscheidet. Die Kompatibilitätstabelle von AMD führt die RX 7700 XT als RDNA-3-Karte mit dem Ziel gfx1101 auf, ebenso wie die RX 7800 XT. Die Ollama-Dokumentation nennt sie unter den unterstützten Grafikkarten für Linux und Windows. Ein Detail beeinflusst die Wahl des Betriebssystems: Laut AMD werden die Radeon RX 7000 und 9000 nur unter Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 und RHEL 9.7 unterstützt. Eine andere Distribution kann funktionieren, allerdings ohne Garantie. Vulkan bleibt das Sicherheitsnetz: Ollama aktiviert es standardmäßig, wenn das Backend installiert ist.
| Umgebung | Status | Quelle |
|---|---|---|
| ROCm unter Linux (Ubuntu 24.04.4, 22.04.5, RHEL 10.1, 9.7) | Offiziell, Ziel gfx1101 | AMD-Kompatibilitätstabelle |
| Ollama unter Linux | Liste der unterstützten Karten | Ollama-Dokumentation, ROCm v7 erforderlich |
| Ollama unter Windows | Liste der unterstützten Karten | Ollama-Dokumentation, ROCm-v7-/HIP7-Stack |
| Vulkan (Ollama, llama.cpp) | Alternative für allgemeine Aufgaben | In Ollama standardmäßig aktiviert |
#Was in 12 GB VRAM passt
Auf einer Karte mit 12 GB können Sie etwa 11 GB für das Modell und seinen KV-Cache einplanen, sofern die Karte nicht auch den Bildschirm ansteuert. Die angegebenen Modellgrößen stammen aus dem QuelLLM-Katalog; der KV-Cache kommt hinzu und wächst mit der Länge des Gesprächs.
| Modell | Gewichte in Q4 | Puffer für den Kontext | Fazit |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 5 GB | Sehr komfortabel |
| Gemma 4 12B | ≈ 7 GB | ≈ 4 GB | Komfortabel, langer Kontext möglich |
| Phi-4 14B | ≈ 9 GB | ≈ 2 GB | Passt, Kontext begrenzen |
| gpt-oss 20B | ≈ 13 GB | keine | Passt nicht vollständig in den VRAM, teilweises Offloading auf die CPU |
| Devstral Small 2 24B | ≈ 14 GB | keine | Mindestens 16 GB erforderlich |
Um ohne Kartenwechsel über 14B hinauszugehen, gibt es zwei Möglichkeiten: den KV-Cache quantisieren, um ein oder zwei Gigabyte freizugeben, oder ein Mixture-of-Experts-Modell (MoE) wählen, bei dem nur wenige Parameter pro Token aktiv sind. Der belegte Speicher entspricht weiterhin der vollständigen Modellgröße. Ein 20B-MoE passt daher nicht besser in 12 GB, generiert aber schneller, sofern es in den Speicher passt.
- Welcher LLM für 12 GB VRAM, unabhängig von der Karte
- Den KV-Cache quantisieren, um VRAM freizugeben
- VRAM-Rechner für Ihr Modell und Ihren Kontext
#Durchsatz: Was wir wissen und was wir schätzen
Seien wir präzise, was die Beleglage angeht: Die beiden öffentlichen Diskussionen im llama.cpp-Repository, eine zu Vulkan und die andere zu ROCm, die AMD-Karten mit demselben Modell (Llama 2 7B in Q4_0) auflisten, enthalten zum Zeitpunkt der Abfassung keinen Eintrag für die RX 7700 XT. Wir haben selbst nichts gemessen. Wir können sie lediglich zwischen zwei Karten mit Messwerten einordnen: der RX 6700 XT mit 83,88 Tokens pro Sekunde bei der Generierung (Bandbreite 384 GB/s) und der RX 7800 XT mit 118,27 (624 GB/s), beide unter Vulkan.
Die Betrachtung der Speicherbandbreite ergibt eine Obergrenze: 432 GB/s geteilt durch 3,82 GB Modellgewichte ergeben etwa 113 Tokens pro Sekunde mit dem 7B-Referenzmodell. Die AMD-Karten aus derselben Diskussion erreichen zwischen 59 % und 83 % dieser Obergrenze (83 % für die 6700 XT, 72 % für die 7800 XT). Auf dieser Grundlage erscheint für die 7700 XT ein Wert zwischen 65 und 95 Tokens pro Sekunde plausibel: Das ist eine Arbeitshypothese, kein Messergebnis; sie muss mit llama-bench bestätigt werden.
| Modell (Q4) | Modellgröße | Obergrenze bei 432 GB/s Bandbreite | Schätzung von 60 bis 80 Prozent des Höchstwerts |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 72 Tokens/s | ≈ 43 bis 58 tokens/s |
| Gemma 4 12B | ≈ 7 GB | ≈ 62 Tokens/s | ≈ 37 bis 49 Tokens pro Sekunde |
| Phi-4 14B | ≈ 9 GB | ≈ 48 Tokens/s | ≈ 29 bis 38 tokens/s |
Für Gespräche lässt sich alles oberhalb von etwa zehn Tokens pro Sekunde angenehm mitlesen; diese Schätzungen liegen daher selbst bei einer erheblichen Fehlermarge deutlich über der Schwelle für eine brauchbare Nutzung.
#Im Vergleich zu den direkten Nachbarmodellen: 6700 XT, 7800 XT und RTX 4070
Die Wahl fällt oft zwischen drei vergleichbaren Karten. Die unter Vulkan veröffentlichten Messwerte helfen, die RTX 4070 einzuordnen, eine der in der Diskussion vertretenen Karten der Ada-Generation mit 12 GB: 92,29 Tokens pro Sekunde bei der Generierung und 3.179 bei der Prompt-Verarbeitung. Ihre 12 GB begrenzen sie ebenso wie die 7700 XT auf dieselben Modelle; die Unterschiede liegen im Software-Ökosystem, der Prompt-Verarbeitung, der Energieeffizienz und dem Preis. Die Durchsatzraten der RX 7700 XT müssen noch gemessen werden, die der drei anderen Karten sind veröffentlicht.
| Karte | VRAM | Bandbreite | Leseleistung pp512 | Generierung tg128 |
|---|---|---|---|---|
| RX 6700 XT | 12 GB | 384 GB/s | 1 051,20 t/s | 83,88 t/s |
| RX 7700 XT | 12 GB | 432 GB/s | nicht veröffentlicht | nicht veröffentlicht |
| RTX 4070 | 12 GB | nicht genannt | 3 179,37 t/s | 92,29 t/s |
| RX 7800 XT | 16 GB | 624 GB/s | 2 017,33 t/s | 118,27 t/s |
Lesen Sie dieses Diagramm: Der Wechsel von der 7700 XT zur 7800 XT kostet nicht nur eine höhere Geschwindigkeit, sondern fügt 4 GB VRAM hinzu, was den Zugriff auf Modelle von 20 bis 24 B ermöglicht. Dies ist der einzige Kriterium, der tatsächlich bestimmt, was Sie starten können. Wenn Ihr Nutzungsszenario ein 8B oder ein 12B betrifft, ist die 7700 XT nicht begrenzend; wenn Sie Modelle für Code von 24B beabsichtigen, ist sie es.
- Radeon RX 7800 XT, derselbe Chip mit 16 GB
- Radeon RX 6700 XT, die vorherige Generation mit 12 GB
- RTX 4070: die NVIDIA-Alternative mit 12 GB
#Start unter Linux
- 01System überprüfenPrüfen Sie, ob Ihre Distribution Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 oder RHEL 9.7 ist. Dies sind die einzigen Versionen, die AMD für diese Karte auflistet.
- 02ROCm-Treiber installierenOllama erfordert den ROCm-v7-Treiber unter Linux. Installieren Sie ihn mit dem Werkzeug amdgpu-install, wie es in der AMD-Dokumentation beschrieben ist.
- 03Ollama und anschließend ein Modell installierenLaden Sie Gemma 4 12B in Q4_K_M oder ein 8B-Modell herunter und starten Sie das Modell anschließend mit ollama run.
- 04Überprüfen, ob die GPU arbeitetFühren Sie ollama ps aus: Die Prozessorspalte muss eine Ausführung auf der GPU anzeigen. Falls die Karte nicht erkannt wird, fügen Sie den Benutzer ollama der Gruppe render hinzu.
- 05Messen und vergleichenStarten Sie llama-bench mit dem GGUF aus der öffentlichen Diskussion, um die Messwerte Ihrer Karte mit denen anderer zu vergleichen und Ihre eigene Messung zu veröffentlichen.
Unter Windows sieht die Ollama-Dokumentation einen ROCm-v7- oder HIP7-Stack für die Radeon RX 7000 vor; für die Installation genügt es, zunächst den aktuellen Radeon-Treiber und anschließend Ollama zu installieren. Der Leitfaden zu Ollama und AMD-GPUs erläutert die hilfreichen Umgebungsvariablen zur Auswahl einer Karte, wenn mehrere im System vorhanden sind.
#Wenn 12 GB nicht mehr ausreichen
Die Grenze ist klar: Bei mehr als 11 GB Modellgewichten passt das Modell nicht mehr vollständig in den VRAM. Ollama und llama.cpp lagern dann einen Teil der Schichten auf die CPU aus, und die Geschwindigkeit bricht ein, weil der Arbeitsspeicher deutlich langsamer als GDDR6 ist. Drei Situationen treten immer wieder auf: ein 24B-Codemodell, ein langer Kontext bei einem 14B-Modell oder ein zweites Modell, das gleichzeitig für RAG geladen ist. Jede dieser Situationen lässt sich mit mehr VRAM lösen, nicht mit mehr Rechenleistung.
| Ihr Einsatzzweck | Reichen 12 GB aus? | Was sich danach ändert |
|---|---|---|
| Chat, Zusammenfassung, Übersetzung mit einem 8B- bis 12B-Modell | Ja | Nichts |
| Code-Assistent mit einem 14B, kurzer Kontext | Ja | Den KV-Cache überwachen |
| Code-Modell 24B oder gpt-oss 20B | Nein | Mindestens 16 GB wählen |
| RAG mit gleichzeitig geladenem Generierungsmodell, Embedding-Modell und Reranker | Knapp | 16 GB nehmen, um Datenübertragungen zu vermeiden |
| Kontext mit mindestens 32.000 Tokens bei einem 14B-Modell | Nein | Den KV-Cache quantisieren oder 16 GB wählen |
Bevor Sie die Karte gebraucht kaufen, prüfen Sie drei konkrete Punkte. Die Leistungsaufnahme der Karte von 245 W erfordert ein geeignetes Netzteil und zwei korrekt angeschlossene PCIe-Stromstecker. Das genaue Kartenmodell ist für den LLM-Betrieb von geringer Bedeutung, da die 12 GB Speicher bei allen Herstellern gleich sind; nur die Qualität der Kühlung unterscheidet sich, was bei langen Generierungssitzungen wichtig ist. Testen Sie die Karte schließlich mit einem echten Modell von 9 bis 10 GB, bevor Sie dem Kauf zustimmen: Nur dieser Test beansprucht den Großteil der 12 GB Speicher und das kontinuierliche erneute Lesen der Gewichte durch ein LLM, was mit einem Videospiel nichts zu tun hat.
#Fazit 2026
- Wenn Sie sie bereits besitzen
- Behalten Sie sie: Sie unterstützt alle Modelle bis 14B offiziell und ohne Umgehungslösungen.
- Wenn Sie gebraucht kaufen
- Vergleichen Sie den Preis mit dem einer RX 7800 XT auf /prix-gpu-ia: Wenn der Preisunterschied gering ist, sind die zusätzlichen 4 GB der 7800 XT den Aufpreis wert.
- Wenn Sie 24B-Modelle nutzen möchten
- Wechseln Sie direkt auf 16 GB oder mehr: Nicht die Leistung, sondern die Kapazität ist der begrenzende Faktor.
- Preise für Grafikkarten für lokale KI, zweimal wöchentlich erfasst
- Ollama-Dokumentation: unterstützte AMD-GPUs
- ROCm-Kompatibilitätstabelle von AMD
- Vulkan-Scoreboard im llama.cpp-Repository
#Häufig gestellte Fragen
Ist die RX 7700 XT für lokale LLM geeignet?+
Welche Modelle lassen sich mit den 12 GB einer RX 7700 XT betreiben?+
Wie viele Tokens pro Sekunde kann eine RX 7700 XT verarbeiten?+
Funktioniert die RX 7700 XT mit Ollama unter Windows?+
RX 7700 XT oder RX 7800 XT für lokale KI?+
Ist Ubuntu erforderlich, um die RX 7700 XT mit ROCm zu verwenden?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.