Einsteiger 3 Min.Ollama

Ollama auf Windows 11 installieren: umfassender Guide (2026)

Direkte Antwort

Unter Windows 11 lässt sich Ollama über ein herkömmliches Installationsprogramm von der offiziellen Website installieren, mit automatischer GPU-Erkennung (native Unterstützung für NVIDIA CUDA). Ein einziger Terminalbefehl (ollama run qwen3.5:4b) lädt ein erstes Modell herunter und startet es in etwa 5 Minuten, ohne manuelle Konfiguration oder komplexe Befehle.

Sie haben einen Windows-PC und möchten ein LLM lokal ausführen, ohne über ChatGPT zu gehen. Ollama ist wahrscheinlich das einfachste Tool dafür: ein klassischer Installer, ein Befehl, ein Modell. In 3 Minuten haben Sie Qwen 3.5 auf Ihrem Rechner am Laufen.

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Getestet auf Windows 11

#Warum Ollama?

Ollama übernimmt für Sie alles, was aufwendig ist: das Herunterladen der Modelle, die Quantisierung, das Laden in den VRAM, die GPU-Erkennung und die lokale HTTP-API. Dahinter steckt llama.cpp. Sie müssen es aber nicht selbst kompilieren.

Das Tool ist kostenlos, Open Source und funktioniert vollständig offline, sobald das Modell heruntergeladen wurde. Es werden keine Daten an einen entfernten Server gesendet.

i
Kurz gesagt
Ollama = ein lokaler Daemon, der im Hintergrund läuft + eine CLI, um mit ihm zu kommunizieren. Die Modelle liegen in einem Ordner auf Ihrer Festplatte. Das ist alles.

#Voraussetzungen

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen
Windows 10 oder 11
64 Bit. Ollama hat keine 32-Bit-Version.
Mindestens 8 GB RAM
16 GB bieten ausreichend Spielraum für Modelle mit 8 bis 9B Parametern in Q4-Quantisierung.
10 GB Speicherplatz
Ein Modell mit 4 bis 9 Milliarden Parametern benötigt etwa 3 bis 7 GB Speicherplatz. Planen Sie großzügig, wenn Sie mehrere Modelle testen möchten.
NVIDIA-GPU (optional)
Aktuelle Treiber, RTX 20/30/40/50 oder GTX 16. Ollama erkennt die GPU automatisch.
→
Ohne GPU funktioniert es ebenfalls
Eine moderne CPU kann ein kleines Modell (2 bis 4B, etwa Qwen 3.5 2B oder Granite 4.2 3B) mit 5–10 Tokens pro Sekunde ausführen. Das ist langsam, aber zum Testen brauchbar. Für den täglichen Einsatz sollten Sie eine GPU mit mindestens 6 GB VRAM anstreben.

#1. Herunterladen

Besuchen Sie die offizielle Website und holen Sie sich den Windows-Installer.

Offizieller Link
https://ollama.com/download/windows

Das Installationsprogramm ist etwa 700 MB groß. Das ist normal: Es enthält die vorkompilierten llama.cpp-Binärdateien mit CUDA-Unterstützung.

!
Prüfen Sie die Domain
Laden Sie Ollama nur von ollama.com herunter. Von Dritten auf GitHub weiterverbreitete Versionen können mit Schadsoftware infiziert sein. Das Tool ist Open Source – wenn Sie paranoid sind, kompilieren Sie es aus dem offiziellen Repository.

#2. Installation

  1. 01
    Starten Sie OllamaSetup.exe
    Doppelklicken Sie auf den heruntergeladenen Installer. Windows Defender kann eine SmartScreen-Warnung anzeigen — klicken Sie auf „Weitere Informationen“ und dann auf „Trotzdem ausführen“.
  2. 02
    Stille Installation
    Kein Konfigurationsfenster: Der Installer installiert sich unter %LOCALAPPDATA%\Programs\Ollama und startet automatisch den Dienst im Hintergrund.
  3. 03
    Prüfen Sie das Symbol im Infobereich
    Ein kleines Ollama-Symbol erscheint unten rechts neben der Uhr. Es zeigt an, dass der Daemon läuft.
  4. 04
    Öffnen Sie ein Terminal
    PowerShell, Windows Terminal oder cmd.exe – egal. Geben Sie den unten stehenden Prüfbefehl ein.
PowerShell
ollama --version

Sie sollten etwas wie ollama version is 0.5.x sehen. Wenn der Befehl nicht erkannt wird, schließen Sie das Terminal und öffnen Sie es erneut – der PATH wurde gerade geändert.

#3. Ihr erstes Modell

Qwen 3.5 4B ist eine gute erste Wahl: mehrsprachig (mit sehr gutem Französisch), leicht, sehr schnell und für seine Größe von ausgezeichneter Qualität. Unter der Apache-2.0-Lizenz.

Herunterladen und starten
ollama run qwen3.5:4b

Beim ersten Mal lädt Ollama das Modell herunter (etwa 3,4 GB in Q4). Bei den folgenden Starts ist es sofort bereit. Sobald die Eingabeaufforderung >>> erscheint, können Sie chatten.

Testkonversation
>>> Bonjour, présente-toi en 2 phrases.

Je suis Qwen 3.5, un modèle de langage open-source développé par l'équipe Qwen (Alibaba).
Je fonctionne entièrement en local sur votre machine, sans connexion internet.
→
Konversation beenden
Geben Sie /bye ein oder drücken Sie Ctrl+D, um die Unterhaltung zu beenden. Das Modell bleibt noch einige Minuten im Speicher geladen, sodass es sich sofort wieder starten lässt.

#4. Prüfen, ob die GPU verwendet wird

Standardmäßig erkennt Ollama Ihre NVIDIA-GPU und lädt das Modell darauf. Um dies zu überprüfen, führen Sie diesen Befehl aus, während eine Unterhaltung läuft:

Status des geladenen Modells
ollama ps

In der Spalte PROCESSOR sollten Sie 100 % GPU sehen. Wenn dort CPU oder ein geringerer GPU-Prozentsatz angezeigt wird, bedeutet das, dass das Modell ganz oder teilweise in den Arbeitsspeicher ausgelagert wird.

i
Zu wenig VRAM?
Qwen 3.5 4B Q4 benötigt etwa 3,4 GB VRAM. Wenn der verfügbare VRAM sehr knapp ist, wählen Sie ein noch kleineres Modell: Granite 4.2 3B (ollama run granite4.2:3b, 2,2 GB) oder Qwen 3.5 2B (ollama run qwen3.5:2b, 1,9 GB).

Um die GPU-Nutzung in Echtzeit zu überwachen, öffnen Sie ein weiteres PowerShell-Fenster:

Monitoring
nvidia-smi -l 1

#5. Eine saubere Oberfläche mit Open WebUI

Das Terminal eignet sich gut zum Testen. Für den täglichen Gebrauch ähnelt Open WebUI ChatGPT – Verlauf, Markdown, Anhänge, alles ist dabei. Der einfachste Weg führt über Docker Desktop.

Open WebUI starten
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui --restart always \
  ghcr.io/open-webui/open-webui:main

Öffnen Sie anschließend http://localhost:3000 im Browser. Erstellen Sie ein Konto (es ist lokal, nichts verlässt Ihr Gerät), und Ihre Ollama-Modelle erscheinen in der Liste.

#Fehlerbehebung

"ollama : Befehl nicht gefunden"
Der PATH wurde nicht neu geladen. Schließen und öffnen Sie alle Terminals erneut. Als letzte Option starten Sie die Windows-Sitzung neu.
Download bleibt bei 0 % hängen
Eine Unternehmensfirewall blockiert manchmal Ollama. Versuchen Sie es über ein anderes Netzwerk oder konfigurieren Sie einen Proxy über die HTTPS_PROXY-Variable.
Das Modell läuft, aber es ist langsam
Prüfen Sie die Ausgabe von ollama ps. Wenn dort 100 % CPU angezeigt wird, hat Ihre GPU entweder zu wenig Speicher oder wird nicht richtig erkannt. Aktualisieren Sie Ihre NVIDIA-Treiber.
Antworten werden nach einigen Zeilen abgebrochen
Das Kontextfenster umfasst standardmäßig 2048 Tokens. Vergrößern Sie es mit /set parameter num_ctx 8192 im Gespräch.

#Weiterführende Informationen

Ollama läuft bei Ihnen. Die nächsten logischen Schritte:

Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.