Ollama + AMD-GPU (ROCm): Konfiguration der Radeon RX 6000 bis 9000
AMD hinkte CUDA lange hinterher, doch ROCm 6 hat so weit aufgeholt, dass Radeon RX 6000, 7000 und 9000 für die LLM-Inferenz voll nutzbar sind. Dieser Leitfaden behandelt die saubere Installation, die Konfiguration von Ollama und den Override, mit dem auch Karten betrieben werden können, die nicht offiziell aufgeführt sind.
#Warum ROCm?
Um die AMD-GPU zu nutzen, muss Ollama (das auf llama.cpp basiert) ROCm verwenden – das AMD-Äquivalent zu CUDA. Ohne ROCm wird die Karte bei der Inferenz nicht erkannt, und alles läuft auf der CPU.
#Offiziell kompatible Karten
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
- RX 7900 XTX / XT / GRE
- gfx1100. Offizieller Support. Etwa 80 % der Leistung einer RTX 4080.
- RX 7800 / 7700 XT
- gfx1101. Offizieller Support ab ROCm 6.1.
- RX 6900 / 6800 / 6700 XT
- gfx1030/1031. Offizielle Unterstützung für große Karten, Override für kleine.
- Instinct MI200 / MI300
- Data-Center-Karten. Vollständiger nativer Support.
#1. ROCm installieren
Die beiden am besten unterstützten Distributionen sind Ubuntu 22.04/24.04 und RHEL/Fedora. Debian-, Arch- und ähnliche Versionen erfordern zusätzliche Anpassungen.
#2. Ollama und ROCm
Ollama 0.3+ erkennt ROCm automatisch. Wenn Sie Ollama VOR ROCm installiert haben, installieren Sie es erneut – das Skript erkennt dann die AMD-GPU und installiert die richtigen Bibliotheken.
#3. Die Nutzung einer nicht unterstützten Karte erzwingen
Wenn rocminfo Ihre GPU nicht auflistet oder Ollama weiterhin die CPU verwendet, zwingt die Variable HSA_OVERRIDE_GFX_VERSION ROCm dazu, mit vorgetäuschten Angaben zu arbeiten.
- RX 6600 / 6700
- HSA_OVERRIDE_GFX_VERSION=10.3.0
- RX 5700 XT
- HSA_OVERRIDE_GFX_VERSION=10.1.0 (instabile Unterstützung)
- RX 6800 / 6900
- Nativ unterstützt, kein Override erforderlich.
#4. Erwartete Leistung
Für Qwen 3.5 9B Q4_K_M (6,6 GB, die Referenzwahl für 8 GB im Jahr 2026) ergeben sich bei der Inferenz folgende Größenordnungen in Tokens pro Sekunde:
- RX 7900 XTX (24 GB)
- ~90 Tok/s. Ähnlich wie eine RTX 4080.
- RX 7800 XT (16 GB)
- ~62 tok/s. Leistung zwischen RTX 4070 und 4070 Ti.
- RX 6900 XT (16 GB)
- ~52 Tok/s. Äquivalent zu RTX 3080 10 GB.
- RX 6700 XT (12 GB, override)
- ~33 Tok/s. Zwischen RTX 3060 und 3060 Ti.
#Fehlerbehebung
- rocminfo ist leer
- Treiber sind nicht installiert oder der Benutzer befindet sich nicht in der Gruppe render. Prüfen Sie groups $USER.
- Ollama nutzt trotz ROCm die CPU
- Oft liegt eine Architekturinkompatibilität vor. Probieren Sie den HSA_OVERRIDE aus, der der nächsthöheren Generation entspricht.
- Crash bei großen Modellen (OOM)
- rocm-smi, um den VRAM-Verbrauch zu sehen. Wenn Sie den Grenzwert überschreiten, verringern Sie num_ctx oder wechseln Sie zu Q3_K_M.
- Mit Ollama inkompatible ROCm-Version
- Ollama wird als Paket für ROCm 6.x bereitgestellt. ROCm 5 funktioniert nicht. Aktualisieren Sie ROCm.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.