Einsteiger 7 minOllama

Was ist Ollama und wie funktioniert es (Leitfaden Anfänger)

Was ist Ollama? Es ist das einfachste Tool, um ein LLM lokal auf Ihrem eigenen Computer auszuführen – ohne Cloud, ohne Abo, ohne an OpenAI gesendete Daten. Dieser Guide erklärt von Grund auf, was Ollama ist, wie es Modelle herunterlädt und ausführt, die drei oder vier Befehle, die Sie 90 % der Zeit verwenden werden, und das Nötigste für den Start.

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Was ist Ollama?

Ollama ist ein Open-Source-Tool, das Sprachmodelle (LLM) direkt auf Ihrem Computer herunterlädt, speichert und ausführt. Sie geben einen Befehl ein, das Modell wird in den Speicher geladen und Sie unterhalten sich mit ihm – entweder über die Kommandozeile oder über eine grafische Benutzeroberfläche, die Sie zusätzlich anbinden. Alles läuft lokal ab: Sobald das Modell heruntergeladen ist, werden keine Daten ins Internet gesendet.

Konkret übernimmt Ollama zwei Funktionen gleichzeitig: Es ist ein Daemon (ein Programm, das im Hintergrund läuft) und eine CLI (eine Befehlszeilenschnittstelle), die mit diesem Daemon kommuniziert. Der Daemon lauscht auf Port 11434 Ihres Rechners und stellt eine kleine HTTP-API bereit – dieselbe wie die von OpenAI, oder zumindest fast. Alle kompatiblen Benutzeroberflächen (Open WebUI, LM Studio im Clientmodus, Continue.dev usw.) können sich daher ohne Änderungen damit verbinden.

i
In einem Satz
Ollama = ein lokaler Daemon, der Open-Weight-LLMs herunterladen und ausführen kann, und eine CLI, um mit ihm zu kommunizieren. Dahinter steckt sauber paketiertes llama.cpp. Sie müssen weder kompilieren noch GGUF-Dateien von Hand handhaben.

Warum steigen so viele darauf um? Weil es sämtliche technischen Hürden beim Einsatz lokaler LLMs beseitigt: keine Kompilierung, keine manuelle GPU-Konfiguration, keine Verwaltung von Python-Versionen. Sie installieren es, geben ollama run qwen3.5:9b ein, und es funktioniert. Es ist das Pendant zu Docker für LLMs: Das Modell und seine Laufzeitumgebung werden in ein einheitliches Format verpackt.

#Wie es intern funktioniert

Das Kit Lokale KI

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Sobald Sie Ollama starten, arbeiten drei Schichten zusammen. Das Verständnis dieser Schichten verändert grundlegend Ihre Fähigkeit, ein Problem zu diagnostizieren.

Der Dienst (ollama serve)
Ein Dienst, der im Hintergrund läuft, unter http://localhost:11434 auf Anfragen wartet und das Laden der Modelle in den Speicher sowie deren Entladen verwaltet. Unter Windows und macOS startet er nach der Installation automatisch. Unter Linux ist er typischerweise ein systemd-Dienst.
Die Inferenz-Engine (llama.cpp)
Er führt die Modelle aus. Ollama enthält eine vorkompilierte Version mit Unterstützung für CUDA (NVIDIA), Metal (Apple Silicon) und CPU. Sie müssen nichts kompilieren.
Die CLI (ollama)
Das Kommandozeilenprogramm, das Sie aufrufen. Es erledigt selbst nicht viel: Es sendet HTTP-Anfragen an den Daemon und zeigt die Antworten an.

Wenn Sie ollama run qwen3.5:9b eingeben, passiert tatsächlich Folgendes: Die CLI fordert den Daemon auf, dieses Modell zu laden; wenn das Modell nicht auf dem Datenträger liegt, lädt der Daemon es aus der Ollama-Registry herunter (ähnlich wie bei Docker Hub); er lädt es in den VRAM, wenn Sie eine kompatible GPU haben, andernfalls in den RAM; und er öffnet eine interaktive Chat-Sitzung. Die gesamte aufwendige Arbeit übernimmt der Daemon – die CLI ist nur ein Client.

→
Port 11434
Das ist der HTTP-Port, den alle verwenden. Wenn eine App angibt, „sich mit Ihrer Ollama-Instanz zu verbinden“, kommuniziert sie mit http://localhost:11434. Wenn Ollama läuft und Sie diese URL in einem Browser öffnen, sehen Sie die Meldung Ollama is running. Das ist der einfachste Funktionstest.

#Befehle: run, pull, list

Drei Befehle decken 90 % des Einsatzes ab. Lernen Sie sie, der Rest wird Ihnen dann offensichtlich erscheinen.

#ollama run

Der Befehl, den Sie als Erstes kennen sollten. Er lädt das Modell herunter, falls es noch nicht vorhanden ist, lädt es in den Speicher und öffnet anschließend eine interaktive Unterhaltung im Terminal.

Terminal
ollama run qwen3.5:9b
# Première fois : télécharge ~6.6 Go puis lance le chat
# Fois suivantes : charge le modèle déjà présent et démarre

Sobald Sie sich in der Sitzung befinden, geben Sie Ihre Frage ein und drücken die Eingabetaste. Zum Beenden geben Sie /bye ein oder drücken Ctrl+D. Für eine mehrzeilige Eingabe beginnen Sie mit drei Anführungszeichen ("""). Alles, was mit / beginnt, ist ein interner Befehl (/show, /set, /clear, /save, /load).

Sie können auch direkt einen Prompt als Argument übergeben – nützlich für Skripte:

One-Shot-Prompt
ollama run qwen3.5:9b "Résume ce texte en 3 points : [...]"

#ollama pull

Lädt ein Modell herunter, ohne es zu starten. Praktisch, wenn Sie mehrere Modelle im Voraus vorbereiten oder eine bestimmte Variante (Größe, Quantisierung) herunterladen möchten.

Terminal
ollama pull granite4.2:3b
ollama pull qwen3.5:9b
ollama pull qwen3.5:9b-q8_0

Der Name folgt dem Format modele:tag. Ohne Tag erhalten Sie die Standardversion (in der Regel ein 8B/9B-Modell mit Q4_K_M-Quantisierung). Mit einem expliziten Tag wählen Sie die Größe (2b, 4b, 9b, 27b, 30b) und die Quantisierung (q4_K_M, q5_K_M, q8_0, fp16).

i
Quantisierung, kurz erklärt
Ein "rohes" Modell wiegt 14 GB für 7 Milliarden Parameter in FP16. Die Quantisierung komprimiert diese Zahlen auf weniger Bits: Q4_K_M (4 Bits) reduziert die Größe um den Faktor ~4 mit minimalen Qualitätsverlusten. Dies ist der empfohlene Sweet Spot zum Einstieg. Q5_K_M ist etwas besser in der Qualität, Q8_0 ist nahezu perfekt, aber 2x schwerer, FP16 ist für leistungsstarke GPUs reserviert.

#ollama list

Zeigt die auf Ihrem Rechner installierten Modelle, ihre Größe auf dem Datenträger und ihr Installationsdatum an.

Terminal
ollama list
# NAME               ID            SIZE    MODIFIED
# qwen3.5:9b         42182419e950  6.6 GB  2 days ago
# granite4.2:8b      f974a74358d6  5.3 GB  1 week ago

#Andere nützliche Befehle

ollama ps
Zeigt die aktuell in den Speicher geladenen Modelle an (und wie viel VRAM/RAM sie verbrauchen). Unverzichtbar, um zu diagnostizieren, warum „alles so langsam läuft“.
ollama rm <modele>
Löscht ein Modell vom Datenträger. Nützlich, wenn der Modellordner langsam 50 GB belegt.
ollama show <modele>
Zeigt die Metadaten eines Modells an: Kontextgröße, Quantisierung, Promptvorlage, Funktionen (Tools, Vision usw.).
ollama serve
Startet den Daemon manuell im Vordergrund. Nützlich unter Linux oder zur Diagnose (Sie sehen die Logs live).
ollama create
Erstellt ein benutzerdefiniertes Modell aus einem Modelfile — dem Gegenstück zu einem Dockerfile für LLMs. Ein fortgeschritteneres Thema.

#Wo werden die Modelle gespeichert?

Modelle können mehrere Gigabyte groß sein. Zu wissen, wo sie gespeichert sind, ist entscheidend, um aufzuräumen, die Bibliothek auf ein anderes Laufwerk zu verschieben oder eine Sicherung anzulegen.

Windows
%USERPROFILE%\.ollama\models — typischerweise C:\Users\votrenom\.ollama\models
macOS
~/.ollama/models
Linux (Installation über das offizielle Skript)
/usr/share/ollama/.ollama/models — le démon tourne sous l'utilisateur ollama
Linux (manuelle Installation auf Benutzerebene)
~/.ollama/models

In diesem Ordner befinden sich zwei Unterverzeichnisse: blobs (die binären Dateien der Modelle, identifiziert durch einen Hash) und manifests (die Metadaten, die beschreiben, welcher blob welchem Tag entspricht). Bearbeiten Sie diese Dateien nicht manuell — verwenden Sie ollama rm et ollama pull pour zum Verwalten.

→
Die Modelle auf ein anderes Laufwerk verschieben
Wenn Ihre System-SSD klein ist und Sie ein größeres zweites Laufwerk haben, setzen Sie die Umgebungsvariable OLLAMA_MODELS so, dass sie auf einen anderen Speicherort verweist. Beispiel: OLLAMA_MODELS=D:\ollama-models unter Windows oder export OLLAMA_MODELS=/mnt/data/ollama-models unter Linux. Starten Sie den Daemon neu, damit die Variable berücksichtigt wird.

#Minimale Konfiguration zum Start

Die Frage „Was ist Ollama und kann mein Gerät es ausführen?“ kommt immer wieder auf. Hier sind die tatsächlichen Mindestanforderungen, nicht die Mindestangaben aus dem Marketing.

8 GB RAM, keine GPU
Beschränkt auf Modelle mit 2–3 Milliarden Parametern in Q4 (Qwen 3.5 2B, Granite 4.2 3B). 5–10 Tokens pro Sekunde auf einer modernen CPU. Zum Testen und Lernen nutzbar.
16 GB RAM, keine GPU
8B-Modelle passen in Q4 in den Speicher (Granite 4.2 8B, Qwen 3.5 9B). Rechnen Sie mit 4–8 Tokens pro Sekunde. Für eine intensive interaktive Nutzung langsam, aber es funktioniert.
GPU mit 8 GB VRAM
Gut für 8B-Modelle in Q4 geeignet (Qwen 3.5 9B, Granite 4.2 8B — 30–50 Tokens/s). Bei 12–14B-Modellen ist die Grenze erreicht.
GPU mit 12 GB VRAM (RTX 3060, 4070)
Der optimale Einstiegspunkt im Jahr 2026. Alle 8B-Modelle laufen flüssig, Gemma 4 12B in Q4 läuft problemlos, oder Qwen 3.5 9B in Q8 bietet die höchste Qualität in dieser Klasse.
GPU mit 16 GB (RTX 4080, 5080) oder Mac M-Pro mit 32 GB Unified Memory
Hier können Sie auf 24B-Modelle in Q4 (Mistral Small 24B, Devstral 24B, gpt-oss 20B) oder für höhere Qualität auf Qwen 3.5 9B in Q8 umsteigen.
GPU mit 24 GB (RTX 3090, 4090) oder Mac M-Max mit mindestens 48 GB
Damit lassen sich 27B- bis 35B-Modelle komfortabel betreiben (Qwen 3.8 27B, Qwen 3.6 35B-A3B), und mit etwas Geduld auch große MoE-Modelle in Q4.

Planen Sie beim Speicherplatz 10 GB pro 7B-Modell in Q4 und 30 GB pro 32B-Modell ein. Wenn Sie von Anfang an 50 bis 100 GB freien Speicherplatz haben, müssen Sie nicht schon nach kurzer Zeit aufräumen.

!
Die Falle: „GPU erkannt“, aber nicht genutzt
Unter Windows und Linux erkennt Ollama die GPU automatisch — außer wenn Ihre NVIDIA-Treiber zu alt sind oder Sie eine AMD-GPU haben, für die ROCm nicht korrekt installiert ist. Prüfen Sie dies mit ollama ps: Wenn die Spalte PROCESSOR 100% CPU anzeigt, obwohl Sie eine GPU haben, ist die Hardwarebeschleunigung nicht aktiv. Unter macOS auf Apple Silicon erfolgt die Metal-Beschleunigung automatisch und ist immer aktiv.

#Erstes empfohlenes Modell

Wenn man Ollama zum ersten Mal ausprobiert, ist der erste Reflex, das größtmögliche Modell zu testen, „einfach mal zum Ausprobieren“. Das ist ein Fehler – Sie füllen den VRAM vollständig, das Modell wird teilweise in den RAM ausgelagert, alles wird langsam, und Sie geben auf. Fangen Sie klein an.

  1. 01
    Qwen 3.5 9B — die vernünftige Standardwahl
    ollama run qwen3.5:9b lädt die Q4_K_M-Version von Qwen 3.5 9B (6,6 GB) herunter. Gute allgemeine Qualität, solides Deutsch, Vision-Eingabe, Kontextfenster 256k. Das ist die Wahl für 8 GB im Jahr 2026 und ein hervorragender Maßstab, um zu beurteilen, was Ihr Rechner leisten kann.
  2. 02
    Granite 4.2 8B – die sparsame Alternative
    ollama run granite4.2:8b für das Modell von IBM (5,3 GB, Apache 2.0). Etwas leichter, sehr sparsam bei Tokens, Kontext 128k. Ein guter Kompromiss, wenn Ihre Karte beim VRAM knapp bemessen ist. Für besonders natürliches Deutsch mit mehr VRAM bleibt Mistral Small 24B (ollama run mistral-small) eine sichere Wahl.
  3. 03
    Qwen 3.5 4B – der kleine, vielseitige Aufsteiger
    ollama run qwen3.5:4b für das neue kleine Standardmodell (3,4 GB, Apache 2.0). Für seine Größe erstaunlich leistungsfähig, brauchbar für einfachen Code und Extraktion. Viele verwenden es als Standard, wenn der VRAM knapp ist.
  4. 04
    Granite 4.2 3B – wenn Ihr Rechner wenig Leistung hat
    ollama run granite4.2:3b für ein Modell, das in 4 GB RAM passt (2,2 GB, Apache 2.0). Weniger leistungsfähig, aber für einfache Aufgaben und zum Erlernen der Funktionsweise von Ollama geeignet, ohne unter langen Ladezeiten zu leiden.
→
Starten Sie ollama ps während eines Chats
Führen Sie während des Chats in einem anderen Terminal ollama ps aus. Sie sehen das geladene Modell, den verwendeten Speicher und die Aufteilung zwischen GPU und CPU. Das ist der beste Weg, konkret zu verstehen, was passiert.

#Tipps und Stolperfallen

Das Modell wird nach 5 Minuten Inaktivität aus dem Speicher entladen
Das ist der Standardwert von OLLAMA_KEEP_ALIVE. Wenn Sie das Modell länger im VRAM behalten möchten, setzen Sie OLLAMA_KEEP_ALIVE=2h (oder -1, damit es nie entladen wird). Setzen Sie dagegen 0, wenn Sie den VRAM unmittelbar nach Abschluss einer Anfrage freigeben möchten.
Abgebrochene Antworten nach einigen Sätzen
Der Standardwert des Parameters num_ctx (Kontextfenster) beträgt 4096 Tokens, unabhängig davon, was das Modell unterstützt. Für RAG oder lange Dokumente erstellen Sie ein Modelfile mit PARAMETER num_ctx 32768 und führen Sie ollama create aus. Achtung: Der VRAM-Verbrauch steigt schnell an.
Keine Shell-Autocompletion
Geben Sie ollama help ein, um alle Befehle anzuzeigen, und ollama help <commande>, um Details zu jedem einzelnen zu sehen. Die Dokumentation befindet sich in der CLI.
Verbindung von einem anderen Rechner im Netzwerk wird abgelehnt
Standardmäßig lauscht Ollama ausschließlich auf 127.0.0.1. Um es im LAN verfügbar zu machen, setzen Sie OLLAMA_HOST=0.0.0.0:11434, bevor Sie den Daemon starten. Denken Sie an die Firewall.
Derselbe Modellname, mehrere Versionen
ollama pull qwen3.5:9b und ollama pull qwen3.5:9b-q8_0 laden zwei getrennte Varianten herunter. Überwachen Sie Ihre Festplatte mit ollama list.
i
Eine grafische Oberfläche in 5 Minuten
Die CLI reicht aus, um die Funktionsweise zu verstehen. Für den täglichen Gebrauch verbinden Sie jedoch Open WebUI (eine Weboberfläche wie ChatGPT) oder LM Studio im Clientmodus mit dem Ollama-Daemon. Diese Tools erkennen den Server auf localhost:11434 automatisch und zeigen alle Ihre Modelle in einer übersichtlichen Oberfläche an.

#Weiterführende Informationen

Sie haben verstanden, was Ollama ist und wie es grundsätzlich funktioniert. Sinnvolle nächste Schritte:

Ollama tatsächlich auf Ihrem Betriebssystem installieren
Die Anleitung „Ollama unter Windows installieren“ (oder unter macOS oder Linux) führt Sie Schritt für Schritt durch die Installation, die GPU-Prüfung und die Einrichtung des ersten Modells in einer sauberen Umgebung.
Die richtige Quantisierung wählen
Der Leitfaden „Die passende Quantisierung wählen (Q4, Q5, Q8, FP16)“ vergleicht die tatsächlichen Qualitätsverluste visuell und hilft Ihnen, Qualität und VRAM-Bedarf gegeneinander abzuwägen.
Eine echte grafische Benutzeroberfläche anbinden
Mit dem Leitfaden „Open WebUI mit Ollama“ installieren Sie in 10 Minuten eine ChatGPT-ähnliche Oberfläche für mehrere Benutzer mit integriertem RAG, die auf dem jetzt vorhandenen Daemon aufsetzt.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.