DeepSeek mit Ollama konfigurieren: Bereitstellungsleitfaden complet
DeepSeek deckt zwei sehr unterschiedliche Anforderungen ab: Code generieren (Coder) und Schritt für Schritt schlussfolgern (R1). Dieser Leitfaden zeigt, wie Sie DeepSeek mit Ollama sauber konfigurieren – die richtige Variante auswählen, Temperatur und Kontextfenster einstellen, innerhalb der verfügbaren VRAM-Kapazität bleiben und mehrere Anfragen parallel verarbeiten. Das Ziel: eine stabile und schnelle Inferenz, ohne bei den Parametern herumprobieren zu müssen.
#Warum sollte DeepSeek mit Ollama konfiguriert werden?
Ollama übernimmt für Sie das Herunterladen der Modellgewichte, die Aufteilung zwischen GPU und CPU sowie die lokale API. Sie erhalten einen Server, der auf http://localhost:11434 lauscht, und einen einzigen Befehl, um eine beliebige DeepSeek-Variante zu starten. Alles Weitere — Temperatur, Kontextgröße, Speicher — lässt sich über einige Parameter steuern, die Sie besser verstehen sollten, statt ihren Auswirkungen ausgeliefert zu sein.
Eine gute Konfiguration macht den Unterschied: DeepSeek R1 gerät bei einer falsch eingestellten Temperatur in Schleifen oder bricht seine Gedankengänge vorzeitig ab; DeepSeek Coder vergisst bei einem zu kurzen Kontext die Hälfte Ihrer Datei. Ziel dieses Leitfadens ist es, diese Einstellungen ein für alle Mal festzulegen.
#DeepSeek Coder vs Chat vs R1: Welches Modell installieren?
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
In der Ollama-Bibliothek gibt es unter dem Namen DeepSeek drei Modellfamilien. Sie werden unterschiedlich konfiguriert, weil sie für unterschiedliche Einsatzzwecke vorgesehen sind.
- deepseek-coder
- Auf Code spezialisiert: Codevervollständigung, Generierung von Funktionen, Refactoring. In kleinen Größen verfügbar (1,3B, 6,7B, 33B). Ideal für die Integration in einen Editor zur lokalen Autovervollständigung.
- deepseek-v3 / deepseek-llm (Chat)
- Allgemeines Konversationsmodell. Direkte Antworten, ohne offengelegte Gedankenkette. Für einen vielseitigen Assistenten auf Französisch ebenso wie auf Englisch.
- deepseek-r1
- Reasoning-Modell: Es entwickelt vor der Antwort eine Gedankenkette (Tags <think>). Hervorragend in Mathematik, Logik und bei mehrstufigen Problemen. Destillierte Versionen mit 1.5B / 7B / 8B / 14B / 32B / 70B, damit sie lokal in den Speicher passen.
Einfache Regel: Code während des Tippens → Coder; ein Assistent für Gespräche → Chat/V3; ein Problem, das Nachdenken erfordert → R1. Sie können problemlos alle drei installieren; Ollama speichert sie nebeneinander.
#Voraussetzungen und VRAM je nach Modellgröße
Ollama muss installiert und sein Dienst aktiv sein. Die Standardquantisierung der DeepSeek-Modelle in Ollama ist Q4_K_M, für die meisten Grafikkarten der beste Kompromiss zwischen Qualität und Speicherbedarf. Hier ist der für Q4 einzuplanende VRAM-Bedarf, allein für die Modellgewichte – rechnen Sie für den Kontext mit 1 bis 2 GB zusätzlich.
- 1,5B – 3B (R1 distilliert)
- ≈ 2 GB · läuft sogar ohne dedizierte GPU oder mühelos auf einer RTX 3060 mit 12 GB.
- 7B – 8B
- ≈ 5 GB · RTX 3060 12 GB, RTX 4070 12 GB. Ein ausgewogener Kompromiss für den täglichen Gebrauch.
- 14B
- ≈ 9 GB · RTX 4070 mit 12 GB: knapp, RTX 4080 mit 16 GB: komfortabel.
- 32B / 33B (Coder)
- ≈ 19 GB · RTX 4090 mit 24 GB oder Mac mit 24–48 GB gemeinsamem Arbeitsspeicher.
- 70B
- ≈ 40 GB · zwei GPUs mit jeweils 24 GB oder ein Mac M4 Pro mit 48 GB oder mehr.
#DeepSeek installieren und starten
- 01Prüfen, ob Ollama läuftDer Dienst muss gestartet sein. `ollama --version` bestätigt die Installation; der Server hört auf dem Port 11434.
- 02Modell herunterladenWählen Sie die Variante und die Größe mit `ollama pull`. Der Tag nach dem : bestimmt die Größe (z. B. :7b, :14b, :32b). Ohne Tag verwendet Ollama die Standardgröße.
- 03Sitzung starten`ollama run` lädt das Modell bei Bedarf herunter und öffnet eine interaktive Promptzeile. Tippen Sie /bye, um zu beenden.
- 04API testenDasselbe Modell ist sofort über die lokale REST-API verfügbar, die sich direkt mit Open WebUI, einem Editor oder Ihren Skripten verbinden lässt.
#Temperatur und Kontextfenster einstellen
Zwei Parameter beeinflussen die Qualität am stärksten: die Temperatur (Kreativität im Vergleich zu Determinismus) und num_ctx (Größe des Kontextfensters). Die Standardwerte von Ollama sind nicht immer ideal, besonders bei R1.
- temperature (R1)
- 0,5 bis 0,7. DeepSeek empfiehlt etwa 0,6 für R1: Bei zu niedrigen Werten gerät das Schlussfolgern ins Stocken; bei zu hohen schweift das Modell ab. Vermeiden Sie 0 bei einem Reasoning-Modell.
- temperature (Coder)
- 0,1 bis 0,3. Für Code wollen wir Determinismus und Wiederholbarkeit, nicht Kreativität.
- num_ctx
- Kontextgröße in Tokens. Der Standardwert liegt oft bei 4096. Erhöhen Sie ihn für lange Dateien oder lange Schlussfolgerungsketten auf 8192 oder 16384 – allerdings steigt dadurch der VRAM-Bedarf.
- top_p
- Etwa 0,95. Im Allgemeinen unverändert lassen; zuerst die Temperatur anpassen.
- repeat_penalty
- Standardwert: 1.1. Nützlich, wenn R1 in seiner Gedankenkette immer wieder dieselben Inhalte wiederholt.
#Die Konfiguration mit einem Modelfile festlegen
Das Einstellen der Parameter bei jeder Sitzung ist aufwendig. Ein Modelfile erstellt eine benannte Variante, die Ihre Einstellungen und einen Systemprompt enthält. Sie erhalten ein fertig konfiguriertes Modell, das wie jedes andere Modell aufgerufen werden kann.
Der gleiche Ansatz gilt für R1: Ein Modelfile mit temperature 0.6 und num_ctx 16384 liefert Ihnen ein abgestimmtes Reasoning-Modell, ohne dass Sie bei jedem Start daran denken müssen.
#VRAM und Speicher optimieren
Wenn ein Modell nicht vollständig in den VRAM passt, verlagert Ollama die überschüssigen Schichten auf die CPU — und die Anzahl der Tokens pro Sekunde bricht ein. Drei Stellschrauben, um vollständig auf der GPU zu bleiben.
- Die Bitbreite der Quantisierung senken
- Q4_K_M als Standard. Bleiben Sie dabei: Das ist bereits der richtige Kompromiss. Wechseln Sie nur zu Q5_K_M oder Q8_0, wenn der VRAM es zulässt und Sie eine etwas höhere Qualität anstreben.
- Die passende Größe wählen
- Ein 14B-Modell, das vollständig auf der GPU läuft, schlägt ein 32B-Modell, das teilweise auf die CPU ausgelagert wird – sowohl bei der Geschwindigkeit als auch beim Bedienkomfort. Wählen Sie das größte Modell, das vollständig in den VRAM passt.
- num_ctx beherrschen
- Der KV-Cache wächst mit dem Kontext. Eine angemessene Kontextgröße (8192) schafft Platz für die Modellgewichte.
- Nach Gebrauch aus dem Speicher entladen
- OLLAMA_KEEP_ALIVE legt fest, wie lange ein Modell nach der letzten Anfrage im Speicher bleibt. Verringern Sie den Wert, um die GPU beim Wechsel zwischen zwei Modellen schneller freizugeben.
#Parallele Ausführung und Nebenläufigkeit
Ollama kann mehrere Anfragen gleichzeitig verarbeiten und mehrere Modelle gleichzeitig geladen halten. Nützlich für einen gemeinsam genutzten Assistenten oder um Coder und R1 gleichzeitig zu betreiben. Zwei Umgebungsvariablen steuern dieses Verhalten.
- OLLAMA_NUM_PARALLEL
- Anzahl der Anfragen, die dasselbe Modell parallel verarbeitet. Jede Anfrage beansprucht ihren eigenen Anteil am Kontext und damit am VRAM. Erhöhen Sie den Wert je nach Grafikkarte vorsichtig (2, 4).
- OLLAMA_MAX_LOADED_MODELS
- Anzahl der verschiedenen Modelle, die gleichzeitig im Speicher gehalten werden. Erhöhen Sie den Wert auf 2, um Coder und R1 gleichzeitig geladen zu halten, sofern der VRAM ausreicht.
#Behebung häufiger Probleme
- R1 hängt in einer Schleife innerhalb von <think> fest
- Temperatur zu niedrig oder repeat_penalty fehlt. Erhöhen Sie temperature auf 0.6 und fügen Sie repeat_penalty 1.1 hinzu.
- Sehr langsames Generieren
- Das Modell wird teilweise auf der CPU ausgeführt. Prüfen Sie `ollama ps`: Wenn PROCESSOR nicht 100 % GPU anzeigt, reduzieren Sie die Modellgröße, die Quantisierungsstufe oder num_ctx.
- Abgeschnittene Antwort
- num_predict (maximale Anzahl generierter Tokens) zu niedrig oder Kontext ausgeschöpft. Erhöhen Sie num_ctx und lassen Sie num_predict unbegrenzt (-1).
- Der Code wird mit Denkprozess-Markern geliefert
- Sie verwenden R1 für Code. Wechseln Sie auf deepseek-coder, der keine Gedankenfolge erzeugt.
#Weiterführende Informationen
Nachdem DeepSeek konfiguriert und kalibriert ist, bieten sich folgende nächste Schritte an: sich eingehender mit R1 befassen, Ihre Varianten verfeinern und die Quantisierung passend zu Ihrer Grafikkarte wählen.
- DeepSeek R1 mit Ollama installieren
- Der eigene Leitfaden zum Reasoning-Modell, zu destillierten Versionen und zur Gedankenkette, um über die Konfiguration hinauszugehen.
- Ein Modell mit Ollama Modelfile anpassen
- Ein System aus Templates, System-Prompts und Parametern – um die hier gezeigten Varianten systematisch produktiv einzusetzen.
- Quantisierung wählen (Q4, Q5, Q8, FP16)
- Die Kompromisse zwischen Qualität und VRAM-Bedarf verstehen, um das größtmögliche DeepSeek-Modell im Speicher Ihrer GPU unterzubringen.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.