Ollama-Probleme beheben: GPU nicht erkannt, langsamer Betrieb, Fehler Speicher
Sie haben Ollama installiert und eine gute GPU, doch die Antworten kommen nur schleppend – ein klassisches Anzeichen dafür, dass Ollama die GPU nicht erkennt und das Modell deshalb auf dem Prozessor ausführt. Dieser Leitfaden behandelt die häufigsten Probleme (CPU-Fallback, Out-of-Memory-Fehler, langsame Antworten, Treiberkonflikte) und liefert jeweils die Diagnosebefehle, mit denen Sie die tatsächliche Ursache finden, statt zu raten.
#Typische Symptome
Ollama fällt selten vollständig aus: Meistens „funktioniert“ es, aber schlecht. Der Daemon lauscht tatsächlich auf http://localhost:11434, das Modell antwortet, aber etwas stimmt nicht. Wer das Symptom erkennt, erhält bereits einen Hinweis auf die richtige Gruppe möglicher Ursachen.
- Sehr langsame Antworten
- Nur wenige Tokens pro Sekunde, obwohl man Dutzende erwartet: Das Modell läuft wahrscheinlich auf der CPU; die GPU wird nicht erkannt oder nicht genutzt.
- GPU mit 0 % Nutzung
- nvidia-smi oder rocm-smi zeigen während der Generierung eine inaktive Grafikkarte an: Ollama hat sie nicht eingebunden.
- Fehler: Out of memory
- Das Laden schlägt fehl oder das Modell wird mit einer CUDA/HIP-Meldung „out of memory“ aus dem Speicher entfernt: Das Modell oder sein Kontext benötigt mehr VRAM, als verfügbar ist.
- Plötzliche Verlangsamung nach einem Update
- Wenn der Durchsatz von einem Tag auf den anderen einbricht, deutet das auf einen Treiber, eine Ollama-Version oder einen CUDA-/ROCm-Konflikt hin.
- Teilweiser Offload
- Ein Teil der Schichten auf GPU, der Rest auf CPU: Das funktioniert, aber viel langsamer als ein vollständiger Offload.
#Prüfen, ob die GPU tatsächlich genutzt wird
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
Bevor Sie nach einer Lösung suchen, muss eine Tatsache geklärt werden: Nutzt Ollama die GPU, ja oder nein? Der direkteste Befehl ist ollama ps. Er zeigt die geladenen Modelle und vor allem die Verteilung zwischen CPU und GPU an, während ein Modell im Speicher liegt.
Die Spalte PROCESSOR ist entscheidend. „100% GPU“ bedeutet, dass das gesamte Modell auf der Grafikkarte liegt – genau das ist gewünscht. „100% CPU“ bestätigt einen vollständigen Fallback auf die CPU. „60%/40% CPU/GPU“ weist auf einen teilweisen Offload hin: Das Modell passt nicht vollständig in den VRAM.
Überwachen Sie zur Gegenprüfung während einer Generierung die GPU über die Anzeige des Herstellers. Wenn die Auslastung steigt, arbeitet die GPU; bleibt sie bei null, ignoriert Ollama die GPU.
#Ollama-Protokolle lesen
Die Serverprotokolle zeigen genau, welches Backend geladen wurde und warum eine GPU ausgewählt oder ausgeschlossen wurde. Sie sind die maßgebliche Informationsquelle, wenn sich ollama ps und nvidia-smi widersprechen.
Suchen Sie nach Zeilen, die „inference compute“, „library=cuda“ oder „library=rocm“ erwähnen, und nach der Anzahl der auf die GPU ausgelagerten Schichten („offloaded X/Y layers to GPU“). Wenn Sie „no compatible GPUs were discovered“ oder „library=cpu“ sehen, haben Sie die Ursache gefunden: Ollama hat keine nutzbare GPU erkannt.
#Der CPU-Fallback und seine klassischen Ursachen
Wenn Ollama die GPU nicht nutzen kann, stürzt es nicht ab: Es wechselt unbemerkt auf die CPU. Dieses Verhalten ist besonders verwirrend, weil scheinbar „alles funktioniert“. Hier sind die häufigsten Ursachen, von den offensichtlichsten bis zu den schwerer erkennbaren.
- 01Nicht genügend VRAM für das ModellWenn das Modell (Gewichte + Kontext) mehr Speicher benötigt, als an freiem VRAM verfügbar ist, lagert Ollama einen Teil oder sogar das gesamte Modell auf die CPU aus. Ein 14B-Modell in Q4 benötigt etwa 9 GB, ein 32B-Modell etwa 19 GB: Auf einer Karte mit 12 GB passt das 32B-Modell niemals vollständig in den VRAM.
- 02GPU-Treiber fehlt oder ist zu altOhne neueres Treiber NVIDIA (oder ROCm von AMD), sieht Ollama keinen kompatiblen GPU und wechselt auf CPU. Das ist der Grundnummer 1 für ein „ollama gpu nicht erkannt“.
- 03GPU wird von einem anderen Prozess genutztEin anderes Modell, ein Spiel, ein Python-Notebook oder eine weitere Ollama-Instanz kann den VRAM bereits vollständig belegen. nvidia-smi listet die Prozesse und den belegten Speicher auf.
- 04Ollama in einem Container ohne GPU-PassthroughIn Docker erkennt der Container die Grafikkarte nicht, wenn --gpus all (NVIDIA) fehlt oder die ROCm-Geräte nicht durchgereicht werden. Der Daemon läuft, nutzt aber die CPU.
- 05GPU nicht unterstütztZu alte Grafikkarten (unzureichende CUDA-Compute-Capability) oder AMD-GPUs, die nicht auf der offiziellen ROCm-Liste stehen: Ollama ignoriert sie absichtlich.
#Out-of-Memory-Fehler: Fehlermeldungen lesen und Fehler beheben
Eine Meldung wie „CUDA error: out of memory“ (oder „HIP out of memory“ bei AMD) bedeutet, dass das Modell mehr VRAM benötigt, als verfügbar ist. Zwei Faktoren erhöhen diesen Bedarf: die Modellgröße und das Kontextfenster. Eine Verringerung des einen oder des anderen behebt das Problem in den meisten Fällen.
- Modell ist zu groß
- Wechseln Sie zu einer leichteren Quantisierung (Q4_K_M statt Q5/Q8) oder zu einem kleineren Modell. Richtwerte für Q4: 7B≈5 GB · 14B≈9 GB · 32B≈19 GB · 70B≈40 GB.
- Zu langer Kontext
- Ein hoher Wert für num_ctx vervielfacht den Speicherbedarf des KV-Caches. Ein kleineres Kontextfenster (num_ctx) gibt viel VRAM frei, besonders bei großen Modellen.
- VRAM fragmentiert durch einen anderen Prozess
- Schließen Sie Spiele, Notebooks und andere Modelle. Starten Sie den Ollama-Daemon neu, um mit bereinigtem VRAM neu zu beginnen.
- Noch belegter Speicher
- Ein zuvor geladenes Modell, das noch im Speicher ist, belegt VRAM. ollama stop <modèle> entlädt es sofort, statt auf keep_alive zu warten.
#NVIDIA-/AMD-Treiber, CUDA und ROCm auf dem neuesten Stand
Viele Probleme mit „Ollama GPU nicht erkannt“ lassen sich durch ein Treiberupdate beheben. Ollama bringt eigene CUDA-/ROCm-Bibliotheken mit, ist aber auf den Systemtreiber angewiesen, um mit der Hardware zu kommunizieren.
Bei AMD ist die Installation von ROCm anspruchsvoller: Die Grafikkarte muss in der Liste der unterstützten GPUs stehen, und manchmal muss eine Umgebungsvariable exportiert werden, um die Unterstützung einer ähnlichen Architektur zu erzwingen (HSA_OVERRIDE_GFX_VERSION). Prüfen Sie zunächst, ob rocminfo die GPU richtig erkennt.
#Plötzliche Verzögerungen
Wenn ein zunächst guter Durchsatz plötzlich stark einbricht, gibt es dafür fast immer eine erkennbare Ursache. Anders als ein dauerhafter CPU-Fallback deutet eine plötzliche Verlangsamung auf eine kürzlich erfolgte Zustandsänderung hin.
- Neu aufgetretenes partielles Offloading
- Sie haben das Kontextfenster vergrößert oder ein größeres Modell geladen: Ein Teil wird nun auf der CPU ausgeführt. Prüfen Sie ollama ps und die Zeile „offloaded N/M layers“.
- Thermische Drosselung
- Eine GPU, die heiß wird, senkt ihre Taktfrequenz. nvidia-smi zeigt die Temperatur und den „P-State“-Status an; oberhalb von ~83 °C drosselt die Karte ihre Leistung.
- Aktualisierung von Ollama oder dem Treiber
- Eine Regression kann die Inferenz verlangsamen. Notieren Sie vor dem Update die funktionierende Version (ollama --version), damit Sie zu ihr zurückkehren können.
- Gemeinsam genutzter VRAM / Systemspeicher
- Unter Windows kann der Treiber bei erschöpftem VRAM auf den System-RAM ausweichen (gemeinsam genutzter GPU-Speicher), wodurch die Leistung einbricht. Verkleinern Sie das Modell, statt es in den System-RAM ausweichen zu lassen.
- Erneutes Laden bei jeder Anfrage
- Ein zu kurzer keep_alive lädt das Modell ständig neu. Erhöhen Sie OLLAMA_KEEP_ALIVE, wenn Sie aufeinanderfolgende Anfragen senden.
#Diagnose-Checkliste
Wenn etwas nicht stimmt, gehen Sie diese Schritte der Reihe nach durch: Sie führen von den häufigsten zu den seltensten Fällen und verhindern, dass Sie in die falsche Richtung suchen.
- 011. Symptom bestätigenollama ps pendant une génération : la colonne PROCESSOR indique-t-elle CPU, GPU ou un mélange ?
- 022. Überprüfen, ob die GPU vom System erkannt wirdAntwortet nvidia-smi (oder rocm-smi)? Andernfalls liegt das Problem im Treiber, nicht bei Ollama.
- 033. Die Protokolle lesenjournalctl -u ollama -f (oder OLLAMA_DEBUG=1 ollama serve): nach „library=cuda/rocm/cpu“ und „offloaded N/M layers“ suchen.
- 044. Den verfügbaren VRAM prüfennvidia-smi: Belegt ein anderer Prozess die Karte? Passt das Modell in den freien VRAM?
- 055. Bei OOM oder teilweisem Offload die Last reduzierenSpeichersparendere Quantisierung, kleineres Modell oder reduzierter Wert für num_ctx. Nicht verwendete Modelle mit ollama stop aus dem Speicher entladen.
- 066. Aktualisieren und neu startenTreiber + Ollama aktuell, danach den Dienst (und die Maschine nach einem Treiberwechsel) neu starten.
#Weiterführende Informationen
Sobald die GPU korrekt erkannt wird, helfen diese Anleitungen auf der Website dabei, das Maximum aus Ihrer Konfiguration herauszuholen und zu verhindern, dass die Probleme erneut auftreten:
- Quantisierung wählen (Q4, Q5, Q8, FP16)
- Hebel Nr. 1 gegen Speicherfehler: Das Qualitäts-/VRAM-Verhältnis verstehen, um ein Format auszuwählen, das auf Ihre Karte passt.
- Ein LLM lokal ohne GPU ausführen (nur CPU)
- Wenn Ihre Hardware kein GPU-Offloading ermöglicht, zeigt dieser Leitfaden, wie ein LLM auch im reinen CPU-Betrieb nutzbar bleibt und welche Modelle Sie je nach RAM-Kapazität wählen sollten.
- Ollama installieren: Windows, macOS und Linux
- Die saubere Installation des Daemons und der Treiber überprüfen – hier liegt oft die eigentliche Ursache dafür, dass eine GPU nicht erkannt wird.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.