Mittelstufe 12 Min.Ollama

Ollama + AMD-GPU (ROCm): Konfiguration der Radeon RX 6000 bis 9000

AMD hinkte CUDA lange hinterher, doch ROCm 6 hat so weit aufgeholt, dass Radeon RX 6000, 7000 und 9000 für die LLM-Inferenz voll nutzbar sind. Dieser Leitfaden behandelt die saubere Installation, die Konfiguration von Ollama und den Override, mit dem auch Karten betrieben werden können, die nicht offiziell aufgeführt sind.

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum ROCm?

Um die AMD-GPU zu nutzen, muss Ollama (das auf llama.cpp basiert) ROCm verwenden – das AMD-Äquivalent zu CUDA. Ohne ROCm wird die Karte bei der Inferenz nicht erkannt, und alles läuft auf der CPU.

i
Alternative: Vulkan
Wenn ROCm nicht mitspielt, funktioniert auch llama.cpp, das mit Vulkan-Unterstützung kompiliert wurde, auf AMD-GPUs (übrigens auch auf Intel Arc). Etwas langsamer, aber einfacher. Siehe den Leitfaden zu llama.cpp mit Vulkan.

#Offiziell kompatible Karten

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen
RX 7900 XTX / XT / GRE
gfx1100. Offizieller Support. Etwa 80 % der Leistung einer RTX 4080.
RX 7800 / 7700 XT
gfx1101. Offizieller Support ab ROCm 6.1.
RX 6900 / 6800 / 6700 XT
gfx1030/1031. Offizielle Unterstützung für große Karten, Override für kleine.
Instinct MI200 / MI300
Data-Center-Karten. Vollständiger nativer Support.
!
RX 6600, 6500, 5700
Offiziell nicht unterstützt. Mit der Variablen HSA_OVERRIDE_GFX_VERSION (siehe unten) ist alles möglich, aber auf eigene Gefahr.

#1. ROCm installieren

Die beiden am besten unterstützten Distributionen sind Ubuntu 22.04/24.04 und RHEL/Fedora. Debian-, Arch- und ähnliche Versionen erfordern zusätzliche Anpassungen.

Ubuntu 24.04
# Dépôt officiel
wget https://repo.radeon.com/amdgpu-install/6.1/ubuntu/noble/amdgpu-install_6.1.60100-1_all.deb
sudo apt install ./amdgpu-install_6.1.60100-1_all.deb

# ROCm + drivers GPU
sudo amdgpu-install --usecase=rocm,graphics

# Droits utilisateur
sudo usermod -aG render,video $USER

# Reboot obligatoire
sudo reboot
Überprüfung nach dem Neustart
rocminfo | grep gfx
# Doit afficher votre architecture, ex : gfx1100

rocm-smi
# Résumé VRAM, température, conso

#2. Ollama und ROCm

Ollama 0.3+ erkennt ROCm automatisch. Wenn Sie Ollama VOR ROCm installiert haben, installieren Sie es erneut – das Skript erkennt dann die AMD-GPU und installiert die richtigen Bibliotheken.

Nach ROCm neu installieren
curl -fsSL https://ollama.com/install.sh | sh
systemctl restart ollama
Testen
ollama run qwen3.5:9b "Test GPU"
# Puis dans un autre terminal :
rocm-smi --showuse
# La ligne GPU[0] doit bouger

#3. Die Nutzung einer nicht unterstützten Karte erzwingen

Wenn rocminfo Ihre GPU nicht auflistet oder Ollama weiterhin die CPU verwendet, zwingt die Variable HSA_OVERRIDE_GFX_VERSION ROCm dazu, mit vorgetäuschten Angaben zu arbeiten.

RX 6600 / 6700
HSA_OVERRIDE_GFX_VERSION=10.3.0
RX 5700 XT
HSA_OVERRIDE_GFX_VERSION=10.1.0 (instabile Unterstützung)
RX 6800 / 6900
Nativ unterstützt, kein Override erforderlich.
Im systemd-Override für Ollama
sudo systemctl edit ollama

# Ajouter :
[Service]
Environment="HSA_OVERRIDE_GFX_VERSION=10.3.0"

sudo systemctl daemon-reload
sudo systemctl restart ollama

#4. Erwartete Leistung

Für Qwen 3.5 9B Q4_K_M (6,6 GB, die Referenzwahl für 8 GB im Jahr 2026) ergeben sich bei der Inferenz folgende Größenordnungen in Tokens pro Sekunde:

RX 7900 XTX (24 GB)
~90 Tok/s. Ähnlich wie eine RTX 4080.
RX 7800 XT (16 GB)
~62 tok/s. Leistung zwischen RTX 4070 und 4070 Ti.
RX 6900 XT (16 GB)
~52 Tok/s. Äquivalent zu RTX 3080 10 GB.
RX 6700 XT (12 GB, override)
~33 Tok/s. Zwischen RTX 3060 und 3060 Ti.
→
VRAM ist König
Bei AMD wie bei NVIDIA ist der VRAM entscheidend dafür, große Modelle ausführen zu können. Eine RX 7900 XTX mit 24 GB führt Qwen 3.6 35B-A3B (23 GB in Q4) aus, das eine RTX 4070 mit 12 GB nicht laden kann, selbst wenn die 4070 bei der reinen Rechenleistung schneller ist.

#Fehlerbehebung

rocminfo ist leer
Treiber sind nicht installiert oder der Benutzer befindet sich nicht in der Gruppe render. Prüfen Sie groups $USER.
Ollama nutzt trotz ROCm die CPU
Oft liegt eine Architekturinkompatibilität vor. Probieren Sie den HSA_OVERRIDE aus, der der nächsthöheren Generation entspricht.
Crash bei großen Modellen (OOM)
rocm-smi, um den VRAM-Verbrauch zu sehen. Wenn Sie den Grenzwert überschreiten, verringern Sie num_ctx oder wechseln Sie zu Q3_K_M.
Mit Ollama inkompatible ROCm-Version
Ollama wird als Paket für ROCm 6.x bereitgestellt. ROCm 5 funktioniert nicht. Aktualisieren Sie ROCm.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.