Ollama installieren: Umfassender Leitfaden (Windows, Mac, Linux)

Sie suchen nach der Lokalinstallation von open-source LLM-Modellen? Lernen Wie installiere ich ollama ist der erste Schritt, um den Zugang zu offenen Modellgewichten auf Ihrem eigenen Rechner zu demokratisieren. Dieses Tool vereinfacht das Herunterladen und Ausführen verschiedener Modelle erheblich, unabhängig davon, ob Sie Windows, macOS oder Linux nutzen. Dieser umfassende Leitfaden erläutert jede Installationsmethode, damit Sie erste Experimente mit leistungsfähigen Architekturen durchführen können, etwa mit DeepSeek V4 Pro 1.6T oder MiMo V2.5 Pro. Wir werden die technischen Schritte, die Leistung und die Nutzungsmöglichkeiten dieser lokalen Plattform untersuchen.

Was ist Ollama und warum sollte man es für lokale LLM verwenden?

Ollama ist ein Werkzeug, das den Einsatz von großen sprachmodellen (LLM) in persönlichen oder lokalen Serverumgebungen vereinfacht. Anstatt manuell komplexe Abhängigkeiten zu verwalten, nutzen Quantisierungsframeworks wie llama.cpp, und die modellspezifischen Konfigurationen manuell zu verwalten, bietet Ollama eine einfache CLI-Schnittstelle. Es fungiert als lokaler Server, über den Sie mit verschiedenen LLM über eine standardisierte API interagieren können.

Wer beim lokalen Experimentieren weitergehen möchte, sollte wissen, dass Tools wie llama.cpp (offizielles GitHub-Repository) bilden oft die technische Grundlage von Ollama. Ob Sie ein leistungsfähiges Modell wie DeepSeek V4 Flash 0731 304B oder die Funktionen von Kimi K2.5, Ollama macht den Zugriff auf diese Gewichte direkter.

Der große Vorteil liegt in der Einfachheit: Eine Anweisung reicht aus, um einen Modell zu laden und zu starten, was ideal für Benutzer ist, die schnell von der Idee zur lokalen Ausführung auf ihrem PC oder Mac übergehen möchten. Wenn Sie verschiedene Architekturen vor der Auswahl Ihrer Installation vergleichen möchten, bieten wir unseren Katalog verzeichnen Hunderte von Modellen mit ihren jeweiligen VRAM-Spezifikationen und Lizenzbedingungen. Sie können die Arbeiten von DeepSeek auf Hugging Face um die Bandbreite ihrer lokal verfügbaren Modelle zu sehen.

Detaillierte Installationsanleitung für jedes Betriebssystem

Der Ablauf variiert je nach Betriebssystem leicht, aber das Grundprinzip bleibt gleich: die ausführbare Ollama-Datei installieren und anschließend die Modelle über die Befehlszeile herunterladen.

Installation auf macOS (Mac)

Für Mac-Nutzer, ob mit Chips der M-Serie oder mit Intel-Rechnern, verläuft die Installation besonders reibungslos. Das offizielle Installationsskript können Sie herunterladen von Ollama (offizielles GitHub-Repository). Nach der Installation startet Ollama im Hintergrund, und Sie können über Ihr Terminal mit den Modellen interagieren. Für spezielle Mac-Konfigurationen, insbesondere zur Optimierung der Nutzung der Apple-Silicon-GPU, konsultieren Sie unseren Leitfaden llm-mac-mini-m4.

Installation unter Windows

Unter Windows haben Sie zwei Hauptmöglichkeiten: die native Binärdatei verwenden oder WSL2 (Windows Subsystem for Linux 2) nutzen. Wenn Sie sich für die native Installation entscheiden, folgen Sie den Anweisungen auf der offiziellen Website. Für eine robustere Integration und bessere Kompatibilität mit Linux-basierten Entwicklungstools empfehlen wir häufig WSL2. Unser Leitfaden ollama-wsl2-vs-windows-natif erläutert diesen Ansatz im Detail.

Installation unter Linux

Die Installation unter Linux erfolgt in der Regel am einfachsten über ein Skript aus dem Repository oder eine vorkompilierte Binärdatei, gemäß den Anweisungen von Ollama (offizielles GitHub-Repository). Eine Schritt-für-Schritt-Anleitung speziell zu den Shell-Befehlen finden Sie in unserem eigenen Tutorial: installer-ollama-linux.

Ausführen und Testen Ihrer ersten LLM-Modelle mit Ollama

Sobald Ollama installiert ist, verwenden Sie den Befehl ollama run <nom_du_modele> um zu beginnen. Hier wählen Sie das Gehirn Ihrer lokalen Sitzung.

Wenn Sie zum Beispiel ein sehr leistungsfähiges Modell ausprobieren möchten, etwa DeepSeek V4 Pro 0813 1.7T, führen Sie den entsprechenden Befehl aus. Es ist wichtig zu beachten, dass Modelle häufig in verschiedenen Versionen (Quantisierungen) angeboten werden, um Größe und Leistung auszubalancieren. Beispielsweise erfordern Modelle wie GLM 5.2 753B-A40B werden eine leistungsfähige Hardwareausstattung benötigen.

Zur Bewertung der reinen Rechenleistung können Sie einen Blick werfen auf das Open LLM Leaderboard (Hugging Face). Wenn Sie eine vollständige Umgebung für die Entwicklung von Agenten einrichten möchten, haben wir Tutorials zur Integration mit CrewAI oder lokalen Agenten vorbereitet crewai-ollama-multi-agents.

Beispiele für Modelle, die getestet werden können: * Für fortgeschrittene Reasoning-Fähigkeiten probieren Sie Inkling (975B) oder DeepSeek V4 Pro 1.6T (1600B). Sie können auch die Fähigkeiten von Kimi K3. * Wenn Sie sich für Programmierung interessieren, Kimi K2.7 Code ist ein guter Ausgangspunkt, um auf Programmierung spezialisierte Modelle zu testen. * Für leichtere Modelle, die lokal schneller laufen, schauen Sie sich Varianten wie Mixtral 8x22B Instruct.

Optimierung und fortgeschrittene Nutzung von Ollama

Die Nutzung lokaler LLMs beschränkt sich nicht auf einfache Gespräche im Terminal. Ollama kann in komplexere Workflows integriert werden. Wenn Sie eine benutzerfreundliche grafische Oberfläche wünschen, empfehlen wir, sich Tools anzusehen wie Open WebUI (offizielle GitHub-Seite), das sich nahtlos in den Ollama-Server integrieren lässt.

Fortgeschrittene Nutzer, die Aufgaben automatisieren oder Anwendungen entwickeln möchten, können direkte API-Aufrufe an ihre Ollama-Instanz konfigurieren. Unser Leitfaden appel-outil-ollama-tutoriel zeigt Ihnen, wie Sie diese LLM in Python-Skripte integrieren können.

Wenn Sie Leistungsprobleme feststellen, insbesondere bei der GPU-Nutzung (GPU-Beschleunigung), lesen Sie unseren Leitfaden depanner-ollama-gpu-erreurs. Einen direkten Vergleich zwischen Ollama und anderen Lösungen wie LM Studio bieten wir in unseren Leitfäden interfaces-graphiques-ollama-comparatif. Wenn Sie spezifischere Alternativen suchen, ist unsere Seite alternatives-ollama-tour-horizon ist eine nützliche Ressource.

FAQ: Häufige Fragen zur Installation von Ollama

Q: Welche Mindestanforderungen muss die Hardware erfüllen, um mit Ollama zu beginnen?

R: Für grundlegende Tests reicht ein modernes System aus. Wenn Sie jedoch größere Modelle ausführen möchten, etwa GLM 5.3 Flash 320B-A18B (das etwa 186 GB in Q4 benötigt), ist eine Grafikkarte mit viel VRAM erforderlich. Bevorzugen Sie bei weniger leistungsfähigen Konfigurationen quantisierte Modelle oder verwenden Sie die CPU nur, wenn Sie bei der Inferenz geduldig sind.

F: Wie wählt man nach der Installation von Ollama ein Modell aus?

A: Die Wahl hängt von Ihrem Einsatzzweck (Chat, Programmierung, logisches Schlussfolgern) und Ihren Hardwareressourcen ab. Wenn Geschwindigkeit entscheidend ist, sehen Sie sich „Flash“-Versionen an, etwa DeepSeek V4 Flash 284B. Für maximale Qualität bei komplexen Aufgaben sehen Sie sich größere Modelle an, etwa Kimi K3 oder DeepSeek V4 Pro 0813 1.7T, indem Sie ihre Spezifikationen stets in unserem Katalog.

F: Funktioniert Ollama ausschließlich mit GGUF-Modellen?

A: Obwohl Ollama weitgehend das GGUF-Format verwendet (optimiert für die Inferenz auf CPU/GPU über llama.cpp), unterstützt es auch andere Formate und kann mit Modellgewichten aus verschiedenen Quellen arbeiten, wobei es sich auf die von der Open-Source-LLM-Community festgelegten Konventionen stützt Hugging Face Hub (Dokumentation).

F: Kann ich Ollama für RAG verwenden?

A: Ja, absolut. Obwohl Ollama die Inferenz-Engine ist, müssen Sie es in ein RAG-Framework (Retrieval Augmented Generation) wie LangChain oder LlamaIndex integrieren. Wir haben spezielle Tutorials zu diesem Thema, beispielsweise anythingllm-rag-tutoriel-complet.

F: Ist Ollama kostenlos und open-source?

R: Das Tool selbst, Ollama, ist auf Zugänglichkeit und einfache Bedienung ausgelegt. Die Modelle, die es ausführt, stehen überwiegend unter offenen Lizenzen (MIT, Apache 2.0) oder unterliegen den Offenheitsrichtlinien von Anbietern wie Moonshot AI auf Hugging Face, was eine freie lokale Nutzung für Experimente gewährleistet.

Fazit: Ihr Zugang zu lokalen LLMs

Zusammenfassend: wie man Ollama installiert ist ein einfacher, aber leistungsfähiger Prozess, der Ihnen Zugang zu Spitzenmodellen auf Ihrer eigenen Infrastruktur eröffnet. Ob Sie Anfänger sind oder als Experte komplexe Systeme integrieren möchten, etwa solche auf Basis von Llama 3.1 405B Instruct, Ollama ist die ideale Orchestrierungslösung. Nach der Installation können Sie unseren Konfigurator um das perfekte Modell zu finden, das zu Ihrer Hardware und Ihren spezifischen Anforderungen passt.

Das Hardware-Setup für die lokale Ausführung eines LLM

Um diese Modelle komfortabel lokal auszuführen, benötigt man RTX 5070 Ti bietet ein hervorragendes Preis-Leistungs-Verhältnis. Vergleichen Sie die Preise:

Darty RTX 5070 Ti →Amazon RTX 5070 Ti →

Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass Ihnen Mehrkosten entstehen. Als Amazon-Partner verdient QuelLLM an qualifizierten Käufen.

Artikel veröffentlicht und aktualisiert am von Mohamed Meguedmi · Quelle der Daten: /api/models.json · Lizenz für den Inhalt: CC BY 4.0.

Möchten Sie einen Fehler oder eine Aktualisierung melden? Mitwirken.