Mittelstufe 11 Min.Ollama

Ollama-Probleme beheben: GPU nicht erkannt, langsamer Betrieb, Fehler Speicher

Sie haben Ollama installiert und eine gute GPU, doch die Antworten kommen nur schleppend – ein klassisches Anzeichen dafür, dass Ollama die GPU nicht erkennt und das Modell deshalb auf dem Prozessor ausführt. Dieser Leitfaden behandelt die häufigsten Probleme (CPU-Fallback, Out-of-Memory-Fehler, langsame Antworten, Treiberkonflikte) und liefert jeweils die Diagnosebefehle, mit denen Sie die tatsächliche Ursache finden, statt zu raten.

Von Marie L.·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Typische Symptome

Ollama fällt selten vollständig aus: Meistens „funktioniert“ es, aber schlecht. Der Daemon lauscht tatsächlich auf http://localhost:11434, das Modell antwortet, aber etwas stimmt nicht. Wer das Symptom erkennt, erhält bereits einen Hinweis auf die richtige Gruppe möglicher Ursachen.

Sehr langsame Antworten
Nur wenige Tokens pro Sekunde, obwohl man Dutzende erwartet: Das Modell läuft wahrscheinlich auf der CPU; die GPU wird nicht erkannt oder nicht genutzt.
GPU mit 0 % Nutzung
nvidia-smi oder rocm-smi zeigen während der Generierung eine inaktive Grafikkarte an: Ollama hat sie nicht eingebunden.
Fehler: Out of memory
Das Laden schlägt fehl oder das Modell wird mit einer CUDA/HIP-Meldung „out of memory“ aus dem Speicher entfernt: Das Modell oder sein Kontext benötigt mehr VRAM, als verfügbar ist.
Plötzliche Verlangsamung nach einem Update
Wenn der Durchsatz von einem Tag auf den anderen einbricht, deutet das auf einen Treiber, eine Ollama-Version oder einen CUDA-/ROCm-Konflikt hin.
Teilweiser Offload
Ein Teil der Schichten auf GPU, der Rest auf CPU: Das funktioniert, aber viel langsamer als ein vollständiger Offload.

#Prüfen, ob die GPU tatsächlich genutzt wird

Das Kit Lokale KI

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Bevor Sie nach einer Lösung suchen, muss eine Tatsache geklärt werden: Nutzt Ollama die GPU, ja oder nein? Der direkteste Befehl ist ollama ps. Er zeigt die geladenen Modelle und vor allem die Verteilung zwischen CPU und GPU an, während ein Modell im Speicher liegt.

Terminal — Status der geladenen Modelle
# Charger un modèle puis, dans un autre terminal, l'interroger
ollama run qwen3.5:9b "bonjour"

# Pendant que le modèle est en mémoire, vérifier la répartition
ollama ps

Die Spalte PROCESSOR ist entscheidend. „100% GPU“ bedeutet, dass das gesamte Modell auf der Grafikkarte liegt – genau das ist gewünscht. „100% CPU“ bestätigt einen vollständigen Fallback auf die CPU. „60%/40% CPU/GPU“ weist auf einen teilweisen Offload hin: Das Modell passt nicht vollständig in den VRAM.

i
Spalte PROCESSOR lesen
ollama ps zeigt die Aufteilung nur an, solange ein Modell im Speicher geladen ist. Standardmäßig entlädt Ollama ein Modell nach 5 Minuten Inaktivität (keep_alive) — führen Sie den Befehl direkt nach einer Generierung aus.

Überwachen Sie zur Gegenprüfung während einer Generierung die GPU über die Anzeige des Herstellers. Wenn die Auslastung steigt, arbeitet die GPU; bleibt sie bei null, ignoriert Ollama die GPU.

Terminal — GPU-Überwachung
# NVIDIA : rafraîchissement toutes les secondes
nvidia-smi -l 1

# AMD (ROCm)
rocm-smi

# Vue plus lisible et interactive (si installé)
nvtop

#Ollama-Protokolle lesen

Die Serverprotokolle zeigen genau, welches Backend geladen wurde und warum eine GPU ausgewählt oder ausgeschlossen wurde. Sie sind die maßgebliche Informationsquelle, wenn sich ollama ps und nvidia-smi widersprechen.

Terminal — Protokolle anzeigen
# Linux (service systemd)
journalctl -u ollama -f

# macOS / lancement manuel : les logs vont sur la sortie du serveur
# Relancer le daemon en verbeux pour tout voir
OLLAMA_DEBUG=1 ollama serve

Suchen Sie nach Zeilen, die „inference compute“, „library=cuda“ oder „library=rocm“ erwähnen, und nach der Anzahl der auf die GPU ausgelagerten Schichten („offloaded X/Y layers to GPU“). Wenn Sie „no compatible GPUs were discovered“ oder „library=cpu“ sehen, haben Sie die Ursache gefunden: Ollama hat keine nutzbare GPU erkannt.

→
Die wichtige Nachricht
Die Zeile „offloaded N/M layers to GPU“ sagt alles: N=M ist perfekt, N<M bedeutet einen teilweisen Offload (zu wenig VRAM), N=0 bedeutet reine CPU-Ausführung. Gehen Sie bei der Diagnose immer von dieser Zeile aus.

#Der CPU-Fallback und seine klassischen Ursachen

Wenn Ollama die GPU nicht nutzen kann, stürzt es nicht ab: Es wechselt unbemerkt auf die CPU. Dieses Verhalten ist besonders verwirrend, weil scheinbar „alles funktioniert“. Hier sind die häufigsten Ursachen, von den offensichtlichsten bis zu den schwerer erkennbaren.

  1. 01
    Nicht genügend VRAM für das Modell
    Wenn das Modell (Gewichte + Kontext) mehr Speicher benötigt, als an freiem VRAM verfügbar ist, lagert Ollama einen Teil oder sogar das gesamte Modell auf die CPU aus. Ein 14B-Modell in Q4 benötigt etwa 9 GB, ein 32B-Modell etwa 19 GB: Auf einer Karte mit 12 GB passt das 32B-Modell niemals vollständig in den VRAM.
  2. 02
    GPU-Treiber fehlt oder ist zu alt
    Ohne neueres Treiber NVIDIA (oder ROCm von AMD), sieht Ollama keinen kompatiblen GPU und wechselt auf CPU. Das ist der Grundnummer 1 für ein „ollama gpu nicht erkannt“.
  3. 03
    GPU wird von einem anderen Prozess genutzt
    Ein anderes Modell, ein Spiel, ein Python-Notebook oder eine weitere Ollama-Instanz kann den VRAM bereits vollständig belegen. nvidia-smi listet die Prozesse und den belegten Speicher auf.
  4. 04
    Ollama in einem Container ohne GPU-Passthrough
    In Docker erkennt der Container die Grafikkarte nicht, wenn --gpus all (NVIDIA) fehlt oder die ROCm-Geräte nicht durchgereicht werden. Der Daemon läuft, nutzt aber die CPU.
  5. 05
    GPU nicht unterstützt
    Zu alte Grafikkarten (unzureichende CUDA-Compute-Capability) oder AMD-GPUs, die nicht auf der offiziellen ROCm-Liste stehen: Ollama ignoriert sie absichtlich.
Terminal — wer belegt den VRAM?
# Voir les processus et la mémoire GPU consommée
nvidia-smi

# Repérer d'autres instances Ollama qui tourneraient déjà
ps aux | grep ollama
!
Docker und GPU
Wenn ein Ollama-Container auf der CPU läuft, obwohl der Host eine GPU hat, liegt das fast immer an fehlendem GPU-Passthrough. Prüfen Sie das Flag --gpus all und die Installation des NVIDIA Container Toolkits auf dem Host.

#Out-of-Memory-Fehler: Fehlermeldungen lesen und Fehler beheben

Eine Meldung wie „CUDA error: out of memory“ (oder „HIP out of memory“ bei AMD) bedeutet, dass das Modell mehr VRAM benötigt, als verfügbar ist. Zwei Faktoren erhöhen diesen Bedarf: die Modellgröße und das Kontextfenster. Eine Verringerung des einen oder des anderen behebt das Problem in den meisten Fällen.

Modell ist zu groß
Wechseln Sie zu einer leichteren Quantisierung (Q4_K_M statt Q5/Q8) oder zu einem kleineren Modell. Richtwerte für Q4: 7B≈5 GB · 14B≈9 GB · 32B≈19 GB · 70B≈40 GB.
Zu langer Kontext
Ein hoher Wert für num_ctx vervielfacht den Speicherbedarf des KV-Caches. Ein kleineres Kontextfenster (num_ctx) gibt viel VRAM frei, besonders bei großen Modellen.
VRAM fragmentiert durch einen anderen Prozess
Schließen Sie Spiele, Notebooks und andere Modelle. Starten Sie den Ollama-Daemon neu, um mit bereinigtem VRAM neu zu beginnen.
Noch belegter Speicher
Ein zuvor geladenes Modell, das noch im Speicher ist, belegt VRAM. ollama stop <modèle> entlädt es sofort, statt auf keep_alive zu warten.
Terminal — Speicherdruck reduzieren
# Décharger un modèle tout de suite
ollama stop qwen3.6:35b

# Lancer avec un contexte réduit (via l'API ou un Modelfile)
# Exemple : forcer num_ctx à 4096 au lieu de la valeur par défaut
ollama run qwen3.5:9b
# puis dans le prompt interactif :
# /set parameter num_ctx 4096
→
Vor dem Laden abschätzen
Addieren Sie die Modellgröße (je nach Quantisierung) und eine Speicherreserve für den Kontext. Versuchen Sie, unter etwa 90 % Ihres gesamten VRAM zu bleiben: Darüber drohen teilweises Offloading oder OOM. Auf einer RTX 4090 mit 24 GB passt ein 32B Q4 (≈19 GB), ein 70B Q4 (≈40 GB) dagegen nicht.

#NVIDIA-/AMD-Treiber, CUDA und ROCm auf dem neuesten Stand

Viele Probleme mit „Ollama GPU nicht erkannt“ lassen sich durch ein Treiberupdate beheben. Ollama bringt eigene CUDA-/ROCm-Bibliotheken mit, ist aber auf den Systemtreiber angewiesen, um mit der Hardware zu kommunizieren.

Terminal — NVIDIA-Treiber prüfen
# Doit afficher la version du driver et CUDA
nvidia-smi

# Si la commande échoue : le driver n'est pas installé ou pas chargé
# Vérifier que le module noyau est bien chargé (Linux)
lsmod | grep nvidia

Bei AMD ist die Installation von ROCm anspruchsvoller: Die Grafikkarte muss in der Liste der unterstützten GPUs stehen, und manchmal muss eine Umgebungsvariable exportiert werden, um die Unterstützung einer ähnlichen Architektur zu erzwingen (HSA_OVERRIDE_GFX_VERSION). Prüfen Sie zunächst, ob rocminfo die GPU richtig erkennt.

Terminal — ROCm (AMD) überprüfen
# Le GPU doit apparaître dans la liste des agents
rocminfo | grep -i gfx

# État et mémoire du GPU AMD
rocm-smi

# Forcer une architecture proche si la carte n'est pas officiellement listée
export HSA_OVERRIDE_GFX_VERSION=11.0.0
!
Starten Sie nach einem Treiberupdate den Dienst neu
Ein neuer Treiber wird erst nach dem erneuten Laden des Kernelmoduls berücksichtigt – am sichersten ist es, den Rechner und anschließend den Ollama-Dienst (sudo systemctl restart ollama) neu zu starten. Ein Daemon, der vor der Aktualisierung gestartet wurde, sieht weiterhin den alten Zustand.

#Plötzliche Verzögerungen

Wenn ein zunächst guter Durchsatz plötzlich stark einbricht, gibt es dafür fast immer eine erkennbare Ursache. Anders als ein dauerhafter CPU-Fallback deutet eine plötzliche Verlangsamung auf eine kürzlich erfolgte Zustandsänderung hin.

Neu aufgetretenes partielles Offloading
Sie haben das Kontextfenster vergrößert oder ein größeres Modell geladen: Ein Teil wird nun auf der CPU ausgeführt. Prüfen Sie ollama ps und die Zeile „offloaded N/M layers“.
Thermische Drosselung
Eine GPU, die heiß wird, senkt ihre Taktfrequenz. nvidia-smi zeigt die Temperatur und den „P-State“-Status an; oberhalb von ~83 °C drosselt die Karte ihre Leistung.
Aktualisierung von Ollama oder dem Treiber
Eine Regression kann die Inferenz verlangsamen. Notieren Sie vor dem Update die funktionierende Version (ollama --version), damit Sie zu ihr zurückkehren können.
Gemeinsam genutzter VRAM / Systemspeicher
Unter Windows kann der Treiber bei erschöpftem VRAM auf den System-RAM ausweichen (gemeinsam genutzter GPU-Speicher), wodurch die Leistung einbricht. Verkleinern Sie das Modell, statt es in den System-RAM ausweichen zu lassen.
Erneutes Laden bei jeder Anfrage
Ein zu kurzer keep_alive lädt das Modell ständig neu. Erhöhen Sie OLLAMA_KEEP_ALIVE, wenn Sie aufeinanderfolgende Anfragen senden.
Terminal — Temperatur und Frequenz
# Surveiller température, conso et fréquence en continu
nvidia-smi -l 1

# Garder les modèles chargés plus longtemps (ex : 30 min)
export OLLAMA_KEEP_ALIVE=30m
sudo systemctl restart ollama

#Diagnose-Checkliste

Wenn etwas nicht stimmt, gehen Sie diese Schritte der Reihe nach durch: Sie führen von den häufigsten zu den seltensten Fällen und verhindern, dass Sie in die falsche Richtung suchen.

  1. 01
    1. Symptom bestätigen
    ollama ps pendant une génération : la colonne PROCESSOR indique-t-elle CPU, GPU ou un mélange ?
  2. 02
    2. Überprüfen, ob die GPU vom System erkannt wird
    Antwortet nvidia-smi (oder rocm-smi)? Andernfalls liegt das Problem im Treiber, nicht bei Ollama.
  3. 03
    3. Die Protokolle lesen
    journalctl -u ollama -f (oder OLLAMA_DEBUG=1 ollama serve): nach „library=cuda/rocm/cpu“ und „offloaded N/M layers“ suchen.
  4. 04
    4. Den verfügbaren VRAM prüfen
    nvidia-smi: Belegt ein anderer Prozess die Karte? Passt das Modell in den freien VRAM?
  5. 05
    5. Bei OOM oder teilweisem Offload die Last reduzieren
    Speichersparendere Quantisierung, kleineres Modell oder reduzierter Wert für num_ctx. Nicht verwendete Modelle mit ollama stop aus dem Speicher entladen.
  6. 06
    6. Aktualisieren und neu starten
    Treiber + Ollama aktuell, danach den Dienst (und die Maschine nach einem Treiberwechsel) neu starten.
i
Vor dem Beheben die Ursache eingrenzen
Die goldene Regel: Ändern Sie immer nur eine Sache und überprüfen Sie das Ergebnis erneut mit ollama ps. Wenn Sie Treiber, Kontext und Modell gleichzeitig ändern, lässt sich nicht mehr feststellen, was das Problem tatsächlich gelöst — oder verschlimmert — hat.

#Weiterführende Informationen

Sobald die GPU korrekt erkannt wird, helfen diese Anleitungen auf der Website dabei, das Maximum aus Ihrer Konfiguration herauszuholen und zu verhindern, dass die Probleme erneut auftreten:

Quantisierung wählen (Q4, Q5, Q8, FP16)
Hebel Nr. 1 gegen Speicherfehler: Das Qualitäts-/VRAM-Verhältnis verstehen, um ein Format auszuwählen, das auf Ihre Karte passt.
Ein LLM lokal ohne GPU ausführen (nur CPU)
Wenn Ihre Hardware kein GPU-Offloading ermöglicht, zeigt dieser Leitfaden, wie ein LLM auch im reinen CPU-Betrieb nutzbar bleibt und welche Modelle Sie je nach RAM-Kapazität wählen sollten.
Ollama installieren: Windows, macOS und Linux
Die saubere Installation des Daemons und der Treiber überprüfen – hier liegt oft die eigentliche Ursache dafür, dass eine GPU nicht erkannt wird.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.