Was ist Ollama und wie funktioniert es (Leitfaden Anfänger)
Was ist Ollama? Es ist das einfachste Tool, um ein LLM lokal auf Ihrem eigenen Computer auszuführen – ohne Cloud, ohne Abo, ohne an OpenAI gesendete Daten. Dieser Guide erklärt von Grund auf, was Ollama ist, wie es Modelle herunterlädt und ausführt, die drei oder vier Befehle, die Sie 90 % der Zeit verwenden werden, und das Nötigste für den Start.
#Was ist Ollama?
Ollama ist ein Open-Source-Tool, das Sprachmodelle (LLM) direkt auf Ihrem Computer herunterlädt, speichert und ausführt. Sie geben einen Befehl ein, das Modell wird in den Speicher geladen und Sie unterhalten sich mit ihm – entweder über die Kommandozeile oder über eine grafische Benutzeroberfläche, die Sie zusätzlich anbinden. Alles läuft lokal ab: Sobald das Modell heruntergeladen ist, werden keine Daten ins Internet gesendet.
Konkret übernimmt Ollama zwei Funktionen gleichzeitig: Es ist ein Daemon (ein Programm, das im Hintergrund läuft) und eine CLI (eine Befehlszeilenschnittstelle), die mit diesem Daemon kommuniziert. Der Daemon lauscht auf Port 11434 Ihres Rechners und stellt eine kleine HTTP-API bereit – dieselbe wie die von OpenAI, oder zumindest fast. Alle kompatiblen Benutzeroberflächen (Open WebUI, LM Studio im Clientmodus, Continue.dev usw.) können sich daher ohne Änderungen damit verbinden.
Warum steigen so viele darauf um? Weil es sämtliche technischen Hürden beim Einsatz lokaler LLMs beseitigt: keine Kompilierung, keine manuelle GPU-Konfiguration, keine Verwaltung von Python-Versionen. Sie installieren es, geben ollama run qwen3.5:9b ein, und es funktioniert. Es ist das Pendant zu Docker für LLMs: Das Modell und seine Laufzeitumgebung werden in ein einheitliches Format verpackt.
#Wie es intern funktioniert
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
Sobald Sie Ollama starten, arbeiten drei Schichten zusammen. Das Verständnis dieser Schichten verändert grundlegend Ihre Fähigkeit, ein Problem zu diagnostizieren.
- Der Dienst (ollama serve)
- Ein Dienst, der im Hintergrund läuft, unter http://localhost:11434 auf Anfragen wartet und das Laden der Modelle in den Speicher sowie deren Entladen verwaltet. Unter Windows und macOS startet er nach der Installation automatisch. Unter Linux ist er typischerweise ein systemd-Dienst.
- Die Inferenz-Engine (llama.cpp)
- Er führt die Modelle aus. Ollama enthält eine vorkompilierte Version mit Unterstützung für CUDA (NVIDIA), Metal (Apple Silicon) und CPU. Sie müssen nichts kompilieren.
- Die CLI (ollama)
- Das Kommandozeilenprogramm, das Sie aufrufen. Es erledigt selbst nicht viel: Es sendet HTTP-Anfragen an den Daemon und zeigt die Antworten an.
Wenn Sie ollama run qwen3.5:9b eingeben, passiert tatsächlich Folgendes: Die CLI fordert den Daemon auf, dieses Modell zu laden; wenn das Modell nicht auf dem Datenträger liegt, lädt der Daemon es aus der Ollama-Registry herunter (ähnlich wie bei Docker Hub); er lädt es in den VRAM, wenn Sie eine kompatible GPU haben, andernfalls in den RAM; und er öffnet eine interaktive Chat-Sitzung. Die gesamte aufwendige Arbeit übernimmt der Daemon – die CLI ist nur ein Client.
#Befehle: run, pull, list
Drei Befehle decken 90 % des Einsatzes ab. Lernen Sie sie, der Rest wird Ihnen dann offensichtlich erscheinen.
#ollama run
Der Befehl, den Sie als Erstes kennen sollten. Er lädt das Modell herunter, falls es noch nicht vorhanden ist, lädt es in den Speicher und öffnet anschließend eine interaktive Unterhaltung im Terminal.
Sobald Sie sich in der Sitzung befinden, geben Sie Ihre Frage ein und drücken die Eingabetaste. Zum Beenden geben Sie /bye ein oder drücken Ctrl+D. Für eine mehrzeilige Eingabe beginnen Sie mit drei Anführungszeichen ("""). Alles, was mit / beginnt, ist ein interner Befehl (/show, /set, /clear, /save, /load).
Sie können auch direkt einen Prompt als Argument übergeben – nützlich für Skripte:
#ollama pull
Lädt ein Modell herunter, ohne es zu starten. Praktisch, wenn Sie mehrere Modelle im Voraus vorbereiten oder eine bestimmte Variante (Größe, Quantisierung) herunterladen möchten.
Der Name folgt dem Format modele:tag. Ohne Tag erhalten Sie die Standardversion (in der Regel ein 8B/9B-Modell mit Q4_K_M-Quantisierung). Mit einem expliziten Tag wählen Sie die Größe (2b, 4b, 9b, 27b, 30b) und die Quantisierung (q4_K_M, q5_K_M, q8_0, fp16).
#ollama list
Zeigt die auf Ihrem Rechner installierten Modelle, ihre Größe auf dem Datenträger und ihr Installationsdatum an.
#Andere nützliche Befehle
- ollama ps
- Zeigt die aktuell in den Speicher geladenen Modelle an (und wie viel VRAM/RAM sie verbrauchen). Unverzichtbar, um zu diagnostizieren, warum „alles so langsam läuft“.
- ollama rm <modele>
- Löscht ein Modell vom Datenträger. Nützlich, wenn der Modellordner langsam 50 GB belegt.
- ollama show <modele>
- Zeigt die Metadaten eines Modells an: Kontextgröße, Quantisierung, Promptvorlage, Funktionen (Tools, Vision usw.).
- ollama serve
- Startet den Daemon manuell im Vordergrund. Nützlich unter Linux oder zur Diagnose (Sie sehen die Logs live).
- ollama create
- Erstellt ein benutzerdefiniertes Modell aus einem Modelfile — dem Gegenstück zu einem Dockerfile für LLMs. Ein fortgeschritteneres Thema.
#Wo werden die Modelle gespeichert?
Modelle können mehrere Gigabyte groß sein. Zu wissen, wo sie gespeichert sind, ist entscheidend, um aufzuräumen, die Bibliothek auf ein anderes Laufwerk zu verschieben oder eine Sicherung anzulegen.
- Windows
- %USERPROFILE%\.ollama\models — typischerweise C:\Users\votrenom\.ollama\models
- macOS
- ~/.ollama/models
- Linux (Installation über das offizielle Skript)
- /usr/share/ollama/.ollama/models — le démon tourne sous l'utilisateur ollama
- Linux (manuelle Installation auf Benutzerebene)
- ~/.ollama/models
In diesem Ordner befinden sich zwei Unterverzeichnisse: blobs (die binären Dateien der Modelle, identifiziert durch einen Hash) und manifests (die Metadaten, die beschreiben, welcher blob welchem Tag entspricht). Bearbeiten Sie diese Dateien nicht manuell — verwenden Sie ollama rm et ollama pull pour zum Verwalten.
#Minimale Konfiguration zum Start
Die Frage „Was ist Ollama und kann mein Gerät es ausführen?“ kommt immer wieder auf. Hier sind die tatsächlichen Mindestanforderungen, nicht die Mindestangaben aus dem Marketing.
- 8 GB RAM, keine GPU
- Beschränkt auf Modelle mit 2–3 Milliarden Parametern in Q4 (Qwen 3.5 2B, Granite 4.2 3B). 5–10 Tokens pro Sekunde auf einer modernen CPU. Zum Testen und Lernen nutzbar.
- 16 GB RAM, keine GPU
- 8B-Modelle passen in Q4 in den Speicher (Granite 4.2 8B, Qwen 3.5 9B). Rechnen Sie mit 4–8 Tokens pro Sekunde. Für eine intensive interaktive Nutzung langsam, aber es funktioniert.
- GPU mit 8 GB VRAM
- Gut für 8B-Modelle in Q4 geeignet (Qwen 3.5 9B, Granite 4.2 8B — 30–50 Tokens/s). Bei 12–14B-Modellen ist die Grenze erreicht.
- GPU mit 12 GB VRAM (RTX 3060, 4070)
- Der optimale Einstiegspunkt im Jahr 2026. Alle 8B-Modelle laufen flüssig, Gemma 4 12B in Q4 läuft problemlos, oder Qwen 3.5 9B in Q8 bietet die höchste Qualität in dieser Klasse.
- GPU mit 16 GB (RTX 4080, 5080) oder Mac M-Pro mit 32 GB Unified Memory
- Hier können Sie auf 24B-Modelle in Q4 (Mistral Small 24B, Devstral 24B, gpt-oss 20B) oder für höhere Qualität auf Qwen 3.5 9B in Q8 umsteigen.
- GPU mit 24 GB (RTX 3090, 4090) oder Mac M-Max mit mindestens 48 GB
- Damit lassen sich 27B- bis 35B-Modelle komfortabel betreiben (Qwen 3.8 27B, Qwen 3.6 35B-A3B), und mit etwas Geduld auch große MoE-Modelle in Q4.
Planen Sie beim Speicherplatz 10 GB pro 7B-Modell in Q4 und 30 GB pro 32B-Modell ein. Wenn Sie von Anfang an 50 bis 100 GB freien Speicherplatz haben, müssen Sie nicht schon nach kurzer Zeit aufräumen.
#Erstes empfohlenes Modell
Wenn man Ollama zum ersten Mal ausprobiert, ist der erste Reflex, das größtmögliche Modell zu testen, „einfach mal zum Ausprobieren“. Das ist ein Fehler – Sie füllen den VRAM vollständig, das Modell wird teilweise in den RAM ausgelagert, alles wird langsam, und Sie geben auf. Fangen Sie klein an.
- 01Qwen 3.5 9B — die vernünftige Standardwahlollama run qwen3.5:9b lädt die Q4_K_M-Version von Qwen 3.5 9B (6,6 GB) herunter. Gute allgemeine Qualität, solides Deutsch, Vision-Eingabe, Kontextfenster 256k. Das ist die Wahl für 8 GB im Jahr 2026 und ein hervorragender Maßstab, um zu beurteilen, was Ihr Rechner leisten kann.
- 02Granite 4.2 8B – die sparsame Alternativeollama run granite4.2:8b für das Modell von IBM (5,3 GB, Apache 2.0). Etwas leichter, sehr sparsam bei Tokens, Kontext 128k. Ein guter Kompromiss, wenn Ihre Karte beim VRAM knapp bemessen ist. Für besonders natürliches Deutsch mit mehr VRAM bleibt Mistral Small 24B (ollama run mistral-small) eine sichere Wahl.
- 03Qwen 3.5 4B – der kleine, vielseitige Aufsteigerollama run qwen3.5:4b für das neue kleine Standardmodell (3,4 GB, Apache 2.0). Für seine Größe erstaunlich leistungsfähig, brauchbar für einfachen Code und Extraktion. Viele verwenden es als Standard, wenn der VRAM knapp ist.
- 04Granite 4.2 3B – wenn Ihr Rechner wenig Leistung hatollama run granite4.2:3b für ein Modell, das in 4 GB RAM passt (2,2 GB, Apache 2.0). Weniger leistungsfähig, aber für einfache Aufgaben und zum Erlernen der Funktionsweise von Ollama geeignet, ohne unter langen Ladezeiten zu leiden.
#Tipps und Stolperfallen
- Das Modell wird nach 5 Minuten Inaktivität aus dem Speicher entladen
- Das ist der Standardwert von OLLAMA_KEEP_ALIVE. Wenn Sie das Modell länger im VRAM behalten möchten, setzen Sie OLLAMA_KEEP_ALIVE=2h (oder -1, damit es nie entladen wird). Setzen Sie dagegen 0, wenn Sie den VRAM unmittelbar nach Abschluss einer Anfrage freigeben möchten.
- Abgebrochene Antworten nach einigen Sätzen
- Der Standardwert des Parameters num_ctx (Kontextfenster) beträgt 4096 Tokens, unabhängig davon, was das Modell unterstützt. Für RAG oder lange Dokumente erstellen Sie ein Modelfile mit PARAMETER num_ctx 32768 und führen Sie ollama create aus. Achtung: Der VRAM-Verbrauch steigt schnell an.
- Keine Shell-Autocompletion
- Geben Sie ollama help ein, um alle Befehle anzuzeigen, und ollama help <commande>, um Details zu jedem einzelnen zu sehen. Die Dokumentation befindet sich in der CLI.
- Verbindung von einem anderen Rechner im Netzwerk wird abgelehnt
- Standardmäßig lauscht Ollama ausschließlich auf 127.0.0.1. Um es im LAN verfügbar zu machen, setzen Sie OLLAMA_HOST=0.0.0.0:11434, bevor Sie den Daemon starten. Denken Sie an die Firewall.
- Derselbe Modellname, mehrere Versionen
- ollama pull qwen3.5:9b und ollama pull qwen3.5:9b-q8_0 laden zwei getrennte Varianten herunter. Überwachen Sie Ihre Festplatte mit ollama list.
#Weiterführende Informationen
Sie haben verstanden, was Ollama ist und wie es grundsätzlich funktioniert. Sinnvolle nächste Schritte:
- Ollama tatsächlich auf Ihrem Betriebssystem installieren
- Die Anleitung „Ollama unter Windows installieren“ (oder unter macOS oder Linux) führt Sie Schritt für Schritt durch die Installation, die GPU-Prüfung und die Einrichtung des ersten Modells in einer sauberen Umgebung.
- Die richtige Quantisierung wählen
- Der Leitfaden „Die passende Quantisierung wählen (Q4, Q5, Q8, FP16)“ vergleicht die tatsächlichen Qualitätsverluste visuell und hilft Ihnen, Qualität und VRAM-Bedarf gegeneinander abzuwägen.
- Eine echte grafische Benutzeroberfläche anbinden
- Mit dem Leitfaden „Open WebUI mit Ollama“ installieren Sie in 10 Minuten eine ChatGPT-ähnliche Oberfläche für mehrere Benutzer mit integriertem RAG, die auf dem jetzt vorhandenen Daemon aufsetzt.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.