Ollama auf Windows 11 installieren: umfassender Guide (2026)
Unter Windows 11 lässt sich Ollama über ein herkömmliches Installationsprogramm von der offiziellen Website installieren, mit automatischer GPU-Erkennung (native Unterstützung für NVIDIA CUDA). Ein einziger Terminalbefehl (ollama run qwen3.5:4b) lädt ein erstes Modell herunter und startet es in etwa 5 Minuten, ohne manuelle Konfiguration oder komplexe Befehle.
Sie haben einen Windows-PC und möchten ein LLM lokal ausführen, ohne über ChatGPT zu gehen. Ollama ist wahrscheinlich das einfachste Tool dafür: ein klassischer Installer, ein Befehl, ein Modell. In 3 Minuten haben Sie Qwen 3.5 auf Ihrem Rechner am Laufen.
#Warum Ollama?
Ollama übernimmt für Sie alles, was aufwendig ist: das Herunterladen der Modelle, die Quantisierung, das Laden in den VRAM, die GPU-Erkennung und die lokale HTTP-API. Dahinter steckt llama.cpp. Sie müssen es aber nicht selbst kompilieren.
Das Tool ist kostenlos, Open Source und funktioniert vollständig offline, sobald das Modell heruntergeladen wurde. Es werden keine Daten an einen entfernten Server gesendet.
#Voraussetzungen
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
- Windows 10 oder 11
- 64 Bit. Ollama hat keine 32-Bit-Version.
- Mindestens 8 GB RAM
- 16 GB bieten ausreichend Spielraum für Modelle mit 8 bis 9B Parametern in Q4-Quantisierung.
- 10 GB Speicherplatz
- Ein Modell mit 4 bis 9 Milliarden Parametern benötigt etwa 3 bis 7 GB Speicherplatz. Planen Sie großzügig, wenn Sie mehrere Modelle testen möchten.
- NVIDIA-GPU (optional)
- Aktuelle Treiber, RTX 20/30/40/50 oder GTX 16. Ollama erkennt die GPU automatisch.
#1. Herunterladen
Besuchen Sie die offizielle Website und holen Sie sich den Windows-Installer.
Das Installationsprogramm ist etwa 700 MB groß. Das ist normal: Es enthält die vorkompilierten llama.cpp-Binärdateien mit CUDA-Unterstützung.
#2. Installation
- 01Starten Sie OllamaSetup.exeDoppelklicken Sie auf den heruntergeladenen Installer. Windows Defender kann eine SmartScreen-Warnung anzeigen — klicken Sie auf „Weitere Informationen“ und dann auf „Trotzdem ausführen“.
- 02Stille InstallationKein Konfigurationsfenster: Der Installer installiert sich unter %LOCALAPPDATA%\Programs\Ollama und startet automatisch den Dienst im Hintergrund.
- 03Prüfen Sie das Symbol im InfobereichEin kleines Ollama-Symbol erscheint unten rechts neben der Uhr. Es zeigt an, dass der Daemon läuft.
- 04Öffnen Sie ein TerminalPowerShell, Windows Terminal oder cmd.exe – egal. Geben Sie den unten stehenden Prüfbefehl ein.
Sie sollten etwas wie ollama version is 0.5.x sehen. Wenn der Befehl nicht erkannt wird, schließen Sie das Terminal und öffnen Sie es erneut – der PATH wurde gerade geändert.
#3. Ihr erstes Modell
Qwen 3.5 4B ist eine gute erste Wahl: mehrsprachig (mit sehr gutem Französisch), leicht, sehr schnell und für seine Größe von ausgezeichneter Qualität. Unter der Apache-2.0-Lizenz.
Beim ersten Mal lädt Ollama das Modell herunter (etwa 3,4 GB in Q4). Bei den folgenden Starts ist es sofort bereit. Sobald die Eingabeaufforderung >>> erscheint, können Sie chatten.
#4. Prüfen, ob die GPU verwendet wird
Standardmäßig erkennt Ollama Ihre NVIDIA-GPU und lädt das Modell darauf. Um dies zu überprüfen, führen Sie diesen Befehl aus, während eine Unterhaltung läuft:
In der Spalte PROCESSOR sollten Sie 100 % GPU sehen. Wenn dort CPU oder ein geringerer GPU-Prozentsatz angezeigt wird, bedeutet das, dass das Modell ganz oder teilweise in den Arbeitsspeicher ausgelagert wird.
Um die GPU-Nutzung in Echtzeit zu überwachen, öffnen Sie ein weiteres PowerShell-Fenster:
#5. Eine saubere Oberfläche mit Open WebUI
Das Terminal eignet sich gut zum Testen. Für den täglichen Gebrauch ähnelt Open WebUI ChatGPT – Verlauf, Markdown, Anhänge, alles ist dabei. Der einfachste Weg führt über Docker Desktop.
Öffnen Sie anschließend http://localhost:3000 im Browser. Erstellen Sie ein Konto (es ist lokal, nichts verlässt Ihr Gerät), und Ihre Ollama-Modelle erscheinen in der Liste.
#Fehlerbehebung
- "ollama : Befehl nicht gefunden"
- Der PATH wurde nicht neu geladen. Schließen und öffnen Sie alle Terminals erneut. Als letzte Option starten Sie die Windows-Sitzung neu.
- Download bleibt bei 0 % hängen
- Eine Unternehmensfirewall blockiert manchmal Ollama. Versuchen Sie es über ein anderes Netzwerk oder konfigurieren Sie einen Proxy über die HTTPS_PROXY-Variable.
- Das Modell läuft, aber es ist langsam
- Prüfen Sie die Ausgabe von ollama ps. Wenn dort 100 % CPU angezeigt wird, hat Ihre GPU entweder zu wenig Speicher oder wird nicht richtig erkannt. Aktualisieren Sie Ihre NVIDIA-Treiber.
- Antworten werden nach einigen Zeilen abgebrochen
- Das Kontextfenster umfasst standardmäßig 2048 Tokens. Vergrößern Sie es mit /set parameter num_ctx 8192 im Gespräch.
#Weiterführende Informationen
Ollama läuft bei Ihnen. Die nächsten logischen Schritte:
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.