Einsteiger 11 Min.Radeon RX 7000

Welches LLM auf Radeon RX 7700 XT (12 GB) ?

Direkte Antwort

Die Radeon RX 7700 XT (12 GB GDDR6, 432 GB/s) wird offiziell von ROCm und Ollama unterstützt, sowohl unter Linux als auch unter Windows. Sie kann Modelle mit 8 bis 14 Milliarden Parametern in Q4 ohne Kompromisse ausführen, reicht aber nicht für Modelle mit 20 bis 24 Milliarden Parametern aus, die 13 bis 14 GB benötigen. Auf den llama.cpp-Scoreboards sind für sie keine Durchsatzwerte veröffentlicht: Ihre Leistung liegt zwischen der einer RX 6700 XT und der einer RX 7800 XT.

Der Wert der RX 7700 XT liegt vor allem darin, was ihre 12 GB ermöglichen, und in ihrer Position innerhalb der Produktreihe: schneller und besser unterstützt als die vorherige Generation, aber unterhalb der 16-GB-Schwelle, die Modelle mit 20 bis 24 Milliarden Parametern ermöglicht. Hier finden Sie eine Entscheidungsgrundlage dafür, ob sie ausreicht – mit Messwerten samt Quellenangaben und klar gekennzeichneten Schätzungen.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Kaufalternative für diesen Guide: Radeon RX 9070 XT 16 GB.

Warum diese Wahl? Unsere vollständige Übersicht zu Radeon RX 9070 XT 16 GB →

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#Was die RX 7700 XT im Jahr 2026 leistet

Eine RX 7700 XT eignet sich für ein mittelgroßes lokales LLM: Ihre 12 GB bieten Platz für Llama 3.1 8B, Gemma 4 12B oder Phi-4 14B in Q4 und lassen noch Raum für den Kontext. Ihre Bandbreite von 432 GB/s liegt 12,5 % über der einer RX 6700 XT und bestimmt die Obergrenze der Generierungsgeschwindigkeit: etwa 113 Tokens pro Sekunde beim 7B-Referenzmodell der Scoreboards, gegenüber 163 bei einer RX 7800 XT. Sie hat einen klaren Vorteil gegenüber der 6700 XT: ROCm und Ollama führen sie offiziell auf, auch für Windows. Ihr Nachteil ist die Speicherkapazität, die sie für Modelle mit 20 bis 24 Milliarden Parametern ungeeignet macht; hier werden die 16 GB der 7800 XT wertvoll.

Architektur
RDNA 3, Navi-32-Chip aus Chiplets (1 GCD und 3 MCD), am 6. September 2023 auf den Markt gebracht.
Berechnung
3.456 Stream-Prozessoren, 54 Recheneinheiten.
Speicher
12 GB GDDR6, 192-Bit-Bus, 432 GB/s.
Verbrauch
245 W Leistungsaufnahme der Karte.
Preis
Hier nicht angegeben: Unter /prix-gpu-ia finden Sie den niedrigsten Preis, der jede Woche erfasst wird.

#ROCm, Ollama und Windows: offizielle Unterstützung

Das ist der Punkt, der sie von der vorherigen Generation unterscheidet. Die Kompatibilitätstabelle von AMD führt die RX 7700 XT als RDNA-3-Karte mit dem Ziel gfx1101 auf, ebenso wie die RX 7800 XT. Die Ollama-Dokumentation nennt sie unter den unterstützten Grafikkarten für Linux und Windows. Ein Detail beeinflusst die Wahl des Betriebssystems: Laut AMD werden die Radeon RX 7000 und 9000 nur unter Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 und RHEL 9.7 unterstützt. Eine andere Distribution kann funktionieren, allerdings ohne Garantie. Vulkan bleibt das Sicherheitsnetz: Ollama aktiviert es standardmäßig, wenn das Backend installiert ist.

Unterstützung für die RX 7700 XT
UmgebungStatusQuelle
ROCm unter Linux (Ubuntu 24.04.4, 22.04.5, RHEL 10.1, 9.7)Offiziell, Ziel gfx1101AMD-Kompatibilitätstabelle
Ollama unter LinuxListe der unterstützten KartenOllama-Dokumentation, ROCm v7 erforderlich
Ollama unter WindowsListe der unterstützten KartenOllama-Dokumentation, ROCm-v7-/HIP7-Stack
Vulkan (Ollama, llama.cpp)Alternative für allgemeine AufgabenIn Ollama standardmäßig aktiviert

#Was in 12 GB VRAM passt

Auf einer Karte mit 12 GB können Sie etwa 11 GB für das Modell und seinen KV-Cache einplanen, sofern die Karte nicht auch den Bildschirm ansteuert. Die angegebenen Modellgrößen stammen aus dem QuelLLM-Katalog; der KV-Cache kommt hinzu und wächst mit der Länge des Gesprächs.

Was auf eine 7700 XT passt (Q4, nur Modellgewichte)
ModellGewichte in Q4Puffer für den KontextFazit
Llama 3.1 8B≈ 6 GB≈ 5 GBSehr komfortabel
Gemma 4 12B≈ 7 GB≈ 4 GBKomfortabel, langer Kontext möglich
Phi-4 14B≈ 9 GB≈ 2 GBPasst, Kontext begrenzen
gpt-oss 20B≈ 13 GBkeinePasst nicht vollständig in den VRAM, teilweises Offloading auf die CPU
Devstral Small 2 24B≈ 14 GBkeineMindestens 16 GB erforderlich

Um ohne Kartenwechsel über 14B hinauszugehen, gibt es zwei Möglichkeiten: den KV-Cache quantisieren, um ein oder zwei Gigabyte freizugeben, oder ein Mixture-of-Experts-Modell (MoE) wählen, bei dem nur wenige Parameter pro Token aktiv sind. Der belegte Speicher entspricht weiterhin der vollständigen Modellgröße. Ein 20B-MoE passt daher nicht besser in 12 GB, generiert aber schneller, sofern es in den Speicher passt.

#Durchsatz: Was wir wissen und was wir schätzen

Seien wir präzise, was die Beleglage angeht: Die beiden öffentlichen Diskussionen im llama.cpp-Repository, eine zu Vulkan und die andere zu ROCm, die AMD-Karten mit demselben Modell (Llama 2 7B in Q4_0) auflisten, enthalten zum Zeitpunkt der Abfassung keinen Eintrag für die RX 7700 XT. Wir haben selbst nichts gemessen. Wir können sie lediglich zwischen zwei Karten mit Messwerten einordnen: der RX 6700 XT mit 83,88 Tokens pro Sekunde bei der Generierung (Bandbreite 384 GB/s) und der RX 7800 XT mit 118,27 (624 GB/s), beide unter Vulkan.

Die Betrachtung der Speicherbandbreite ergibt eine Obergrenze: 432 GB/s geteilt durch 3,82 GB Modellgewichte ergeben etwa 113 Tokens pro Sekunde mit dem 7B-Referenzmodell. Die AMD-Karten aus derselben Diskussion erreichen zwischen 59 % und 83 % dieser Obergrenze (83 % für die 6700 XT, 72 % für die 7800 XT). Auf dieser Grundlage erscheint für die 7700 XT ein Wert zwischen 65 und 95 Tokens pro Sekunde plausibel: Das ist eine Arbeitshypothese, kein Messergebnis; sie muss mit llama-bench bestätigt werden.

Theoretischer Grenzwert pro Modell auf einer 7700 XT (Berechnung)
Modell (Q4)ModellgrößeObergrenze bei 432 GB/s BandbreiteSchätzung von 60 bis 80 Prozent des Höchstwerts
Llama 3.1 8B≈ 6 GB≈ 72 Tokens/s≈ 43 bis 58 tokens/s
Gemma 4 12B≈ 7 GB≈ 62 Tokens/s≈ 37 bis 49 Tokens pro Sekunde
Phi-4 14B≈ 9 GB≈ 48 Tokens/s≈ 29 bis 38 tokens/s

Für Gespräche lässt sich alles oberhalb von etwa zehn Tokens pro Sekunde angenehm mitlesen; diese Schätzungen liegen daher selbst bei einer erheblichen Fehlermarge deutlich über der Schwelle für eine brauchbare Nutzung.

#Im Vergleich zu den direkten Nachbarmodellen: 6700 XT, 7800 XT und RTX 4070

Die Wahl fällt oft zwischen drei vergleichbaren Karten. Die unter Vulkan veröffentlichten Messwerte helfen, die RTX 4070 einzuordnen, eine der in der Diskussion vertretenen Karten der Ada-Generation mit 12 GB: 92,29 Tokens pro Sekunde bei der Generierung und 3.179 bei der Prompt-Verarbeitung. Ihre 12 GB begrenzen sie ebenso wie die 7700 XT auf dieselben Modelle; die Unterschiede liegen im Software-Ökosystem, der Prompt-Verarbeitung, der Energieeffizienz und dem Preis. Die Durchsatzraten der RX 7700 XT müssen noch gemessen werden, die der drei anderen Karten sind veröffentlicht.

7700 XT und ähnliche Karten (Llama 2 7B Q4_0, Vulkan, ohne Flash Attention)
KarteVRAMBandbreiteLeseleistung pp512Generierung tg128
RX 6700 XT12 GB384 GB/s1 051,20 t/s83,88 t/s
RX 7700 XT12 GB432 GB/snicht veröffentlichtnicht veröffentlicht
RTX 407012 GBnicht genannt3 179,37 t/s92,29 t/s
RX 7800 XT16 GB624 GB/s2 017,33 t/s118,27 t/s

Lesen Sie dieses Diagramm: Der Wechsel von der 7700 XT zur 7800 XT kostet nicht nur eine höhere Geschwindigkeit, sondern fügt 4 GB VRAM hinzu, was den Zugriff auf Modelle von 20 bis 24 B ermöglicht. Dies ist der einzige Kriterium, der tatsächlich bestimmt, was Sie starten können. Wenn Ihr Nutzungsszenario ein 8B oder ein 12B betrifft, ist die 7700 XT nicht begrenzend; wenn Sie Modelle für Code von 24B beabsichtigen, ist sie es.

#Start unter Linux

  1. 01
    System überprüfen
    Prüfen Sie, ob Ihre Distribution Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 oder RHEL 9.7 ist. Dies sind die einzigen Versionen, die AMD für diese Karte auflistet.
  2. 02
    ROCm-Treiber installieren
    Ollama erfordert den ROCm-v7-Treiber unter Linux. Installieren Sie ihn mit dem Werkzeug amdgpu-install, wie es in der AMD-Dokumentation beschrieben ist.
  3. 03
    Ollama und anschließend ein Modell installieren
    Laden Sie Gemma 4 12B in Q4_K_M oder ein 8B-Modell herunter und starten Sie das Modell anschließend mit ollama run.
  4. 04
    Überprüfen, ob die GPU arbeitet
    Führen Sie ollama ps aus: Die Prozessorspalte muss eine Ausführung auf der GPU anzeigen. Falls die Karte nicht erkannt wird, fügen Sie den Benutzer ollama der Gruppe render hinzu.
  5. 05
    Messen und vergleichen
    Starten Sie llama-bench mit dem GGUF aus der öffentlichen Diskussion, um die Messwerte Ihrer Karte mit denen anderer zu vergleichen und Ihre eigene Messung zu veröffentlichen.
Terminal
ollama ps
rocminfo | grep -i gfx
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

Unter Windows sieht die Ollama-Dokumentation einen ROCm-v7- oder HIP7-Stack für die Radeon RX 7000 vor; für die Installation genügt es, zunächst den aktuellen Radeon-Treiber und anschließend Ollama zu installieren. Der Leitfaden zu Ollama und AMD-GPUs erläutert die hilfreichen Umgebungsvariablen zur Auswahl einer Karte, wenn mehrere im System vorhanden sind.

#Wenn 12 GB nicht mehr ausreichen

Die Grenze ist klar: Bei mehr als 11 GB Modellgewichten passt das Modell nicht mehr vollständig in den VRAM. Ollama und llama.cpp lagern dann einen Teil der Schichten auf die CPU aus, und die Geschwindigkeit bricht ein, weil der Arbeitsspeicher deutlich langsamer als GDDR6 ist. Drei Situationen treten immer wieder auf: ein 24B-Codemodell, ein langer Kontext bei einem 14B-Modell oder ein zweites Modell, das gleichzeitig für RAG geladen ist. Jede dieser Situationen lässt sich mit mehr VRAM lösen, nicht mit mehr Rechenleistung.

Soll man bei 12 GB bleiben?
Ihr EinsatzzweckReichen 12 GB aus?Was sich danach ändert
Chat, Zusammenfassung, Übersetzung mit einem 8B- bis 12B-ModellJaNichts
Code-Assistent mit einem 14B, kurzer KontextJaDen KV-Cache überwachen
Code-Modell 24B oder gpt-oss 20BNeinMindestens 16 GB wählen
RAG mit gleichzeitig geladenem Generierungsmodell, Embedding-Modell und RerankerKnapp16 GB nehmen, um Datenübertragungen zu vermeiden
Kontext mit mindestens 32.000 Tokens bei einem 14B-ModellNeinDen KV-Cache quantisieren oder 16 GB wählen

Bevor Sie die Karte gebraucht kaufen, prüfen Sie drei konkrete Punkte. Die Leistungsaufnahme der Karte von 245 W erfordert ein geeignetes Netzteil und zwei korrekt angeschlossene PCIe-Stromstecker. Das genaue Kartenmodell ist für den LLM-Betrieb von geringer Bedeutung, da die 12 GB Speicher bei allen Herstellern gleich sind; nur die Qualität der Kühlung unterscheidet sich, was bei langen Generierungssitzungen wichtig ist. Testen Sie die Karte schließlich mit einem echten Modell von 9 bis 10 GB, bevor Sie dem Kauf zustimmen: Nur dieser Test beansprucht den Großteil der 12 GB Speicher und das kontinuierliche erneute Lesen der Gewichte durch ein LLM, was mit einem Videospiel nichts zu tun hat.

#Fazit 2026

Wenn Sie sie bereits besitzen
Behalten Sie sie: Sie unterstützt alle Modelle bis 14B offiziell und ohne Umgehungslösungen.
Wenn Sie gebraucht kaufen
Vergleichen Sie den Preis mit dem einer RX 7800 XT auf /prix-gpu-ia: Wenn der Preisunterschied gering ist, sind die zusätzlichen 4 GB der 7800 XT den Aufpreis wert.
Wenn Sie 24B-Modelle nutzen möchten
Wechseln Sie direkt auf 16 GB oder mehr: Nicht die Leistung, sondern die Kapazität ist der begrenzende Faktor.

#Häufig gestellte Fragen

FAQ
Ist die RX 7700 XT für lokale LLM geeignet?+
Ja, für Modelle mit 8 bis 14 Milliarden Parametern in Q4, mit offizieller Unterstützung durch ROCm und Ollama. Ihre 12 GB beschränken sie auf Modelle unterhalb der Größenklasse von 20 bis 24B. Das ist ihr größter Nachteil gegenüber der RX 7800 XT mit ihren 16 GB.
Welche Modelle lassen sich mit den 12 GB einer RX 7700 XT betreiben?+
Llama 3.1 8B, Gemma 4 12B und Phi-4 14B in Q4, also 6 bis 9 GB Modellgewichte, mit Platz für den Kontext. Ein Modell mit 20 bis 24 Milliarden Parametern ist in Q4 13 bis 14 GB groß: Es passt nicht vollständig in den VRAM und läuft teilweise auf der CPU, wodurch die Geschwindigkeit deutlich sinkt.
Wie viele Tokens pro Sekunde kann eine RX 7700 XT verarbeiten?+
In den Diskussionen des llama.cpp-Repositorys wurden keine Messwerte veröffentlicht. Die Berechnung ergibt eine Obergrenze von etwa 113 Tokens pro Sekunde bei einem 7B-Modell in Q4_0. Bei vergleichbaren AMD-Karten werden üblicherweise 59 bis 83 % dieser Obergrenze beobachtet. Messen Sie die Karte selbst mit llama-bench, bevor Sie konkrete Zahlen angeben.
Funktioniert die RX 7700 XT mit Ollama unter Windows?+
Ja: Die Ollama-Dokumentation führt sie unter den unter Windows unterstützten Radeon-RX-Karten auf; erforderlich ist ein ROCm-v7- oder HIP7-Softwarestack. Unter Linux ist sie ebenfalls aufgeführt, mit dem ROCm-v7-Treiber. Vulkan ist in Ollama standardmäßig aktiviert und dient als Ausweichlösung, falls die Erkennung fehlschlägt.
RX 7700 XT oder RX 7800 XT für lokale KI?+
Die 7800 XT, wenn Sie Modelle mit 20 bis 24 Milliarden Parametern beabsichtigen, dank ihren 16 GB und der Bandbreite von 624 GB/s gegenüber 432 GB/s. Die 7700 XT reicht aus, wenn Ihr Nutzungsbereich zwischen 8 und 14 Milliarden Parametern liegt. Vergleichen Sie die aktuellen Preise, bevor Sie eine Entscheidung treffen.
Ist Ubuntu erforderlich, um die RX 7700 XT mit ROCm zu verwenden?+
AMD unterstützt die Radeon RX 7000 offiziell nur unter Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 und RHEL 9.7. Eine andere Distribution kann funktionieren, jedoch ohne garantierten Support. Unter Windows nutzt Ollama einen ROCm-v7- oder HIP7-Stack; Vulkan bleibt überall möglich.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.