Mittelstufe 15 minWerkzeuge

DeepSeek mit Ollama konfigurieren: Bereitstellungsleitfaden complet

DeepSeek deckt zwei sehr unterschiedliche Anforderungen ab: Code generieren (Coder) und Schritt für Schritt schlussfolgern (R1). Dieser Leitfaden zeigt, wie Sie DeepSeek mit Ollama sauber konfigurieren – die richtige Variante auswählen, Temperatur und Kontextfenster einstellen, innerhalb der verfügbaren VRAM-Kapazität bleiben und mehrere Anfragen parallel verarbeiten. Das Ziel: eine stabile und schnelle Inferenz, ohne bei den Parametern herumprobieren zu müssen.

Von Mohamed Meguedmi·Aktualisierung 2026-08-28·Unter Windows, macOS und Linux getestet

#Warum sollte DeepSeek mit Ollama konfiguriert werden?

Ollama übernimmt für Sie das Herunterladen der Modellgewichte, die Aufteilung zwischen GPU und CPU sowie die lokale API. Sie erhalten einen Server, der auf http://localhost:11434 lauscht, und einen einzigen Befehl, um eine beliebige DeepSeek-Variante zu starten. Alles Weitere — Temperatur, Kontextgröße, Speicher — lässt sich über einige Parameter steuern, die Sie besser verstehen sollten, statt ihren Auswirkungen ausgeliefert zu sein.

Eine gute Konfiguration macht den Unterschied: DeepSeek R1 gerät bei einer falsch eingestellten Temperatur in Schleifen oder bricht seine Gedankengänge vorzeitig ab; DeepSeek Coder vergisst bei einem zu kurzen Kontext die Hälfte Ihrer Datei. Ziel dieses Leitfadens ist es, diese Einstellungen ein für alle Mal festzulegen.

#DeepSeek Coder vs Chat vs R1: Welches Modell installieren?

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

In der Ollama-Bibliothek gibt es unter dem Namen DeepSeek drei Modellfamilien. Sie werden unterschiedlich konfiguriert, weil sie für unterschiedliche Einsatzzwecke vorgesehen sind.

deepseek-coder
Auf Code spezialisiert: Codevervollständigung, Generierung von Funktionen, Refactoring. In kleinen Größen verfügbar (1,3B, 6,7B, 33B). Ideal für die Integration in einen Editor zur lokalen Autovervollständigung.
deepseek-v3 / deepseek-llm (Chat)
Allgemeines Konversationsmodell. Direkte Antworten, ohne offengelegte Gedankenkette. Für einen vielseitigen Assistenten auf Französisch ebenso wie auf Englisch.
deepseek-r1
Reasoning-Modell: Es entwickelt vor der Antwort eine Gedankenkette (Tags <think>). Hervorragend in Mathematik, Logik und bei mehrstufigen Problemen. Destillierte Versionen mit 1.5B / 7B / 8B / 14B / 32B / 70B, damit sie lokal in den Speicher passen.
i
R1: Es handelt sich um distillierte Modelle
Die Varianten von deepseek-r1 mit 7B bis 70B auf Ollama sind auf Qwen und Llama basierende Destillationen, nicht das vollständige 671B-Modell. Dadurch lassen sie sich auf einer handelsüblichen Grafikkarte ausführen – mit einem Teil der Denkfähigkeiten des großen Bruders.

Einfache Regel: Code während des Tippens → Coder; ein Assistent für Gespräche → Chat/V3; ein Problem, das Nachdenken erfordert → R1. Sie können problemlos alle drei installieren; Ollama speichert sie nebeneinander.

#Voraussetzungen und VRAM je nach Modellgröße

Ollama muss installiert und sein Dienst aktiv sein. Die Standardquantisierung der DeepSeek-Modelle in Ollama ist Q4_K_M, für die meisten Grafikkarten der beste Kompromiss zwischen Qualität und Speicherbedarf. Hier ist der für Q4 einzuplanende VRAM-Bedarf, allein für die Modellgewichte – rechnen Sie für den Kontext mit 1 bis 2 GB zusätzlich.

1,5B – 3B (R1 distilliert)
≈ 2 GB · läuft sogar ohne dedizierte GPU oder mühelos auf einer RTX 3060 mit 12 GB.
7B – 8B
≈ 5 GB · RTX 3060 12 GB, RTX 4070 12 GB. Ein ausgewogener Kompromiss für den täglichen Gebrauch.
14B
≈ 9 GB · RTX 4070 mit 12 GB: knapp, RTX 4080 mit 16 GB: komfortabel.
32B / 33B (Coder)
≈ 19 GB · RTX 4090 mit 24 GB oder Mac mit 24–48 GB gemeinsamem Arbeitsspeicher.
70B
≈ 40 GB · zwei GPUs mit jeweils 24 GB oder ein Mac M4 Pro mit 48 GB oder mehr.
→
Vor dem Herunterladen prüfen
Führen Sie nach einem ersten Test `ollama ps` aus: Die Spalte PROCESSOR zeigt 100% GPU an, wenn das Modell vollständig in den VRAM passt, oder eine Aufteilung zwischen GPU und CPU, wenn es nicht vollständig hineinpasst. Eine solche Aufteilung führt zu einer deutlichen Verlangsamung; wählen Sie dann ein kleineres Modell oder eine Quantisierung mit weniger Bits.

#DeepSeek installieren und starten

  1. 01
    Prüfen, ob Ollama läuft
    Der Dienst muss gestartet sein. `ollama --version` bestätigt die Installation; der Server hört auf dem Port 11434.
  2. 02
    Modell herunterladen
    Wählen Sie die Variante und die Größe mit `ollama pull`. Der Tag nach dem : bestimmt die Größe (z. B. :7b, :14b, :32b). Ohne Tag verwendet Ollama die Standardgröße.
  3. 03
    Sitzung starten
    `ollama run` lädt das Modell bei Bedarf herunter und öffnet eine interaktive Promptzeile. Tippen Sie /bye, um zu beenden.
  4. 04
    API testen
    Dasselbe Modell ist sofort über die lokale REST-API verfügbar, die sich direkt mit Open WebUI, einem Editor oder Ihren Skripten verbinden lässt.
Terminal — herunterladen und starten
# Modèle de raisonnement, distillation 7B
ollama pull deepseek-r1:7b

# Modèle de code, 6.7B
ollama pull deepseek-coder:6.7b

# Lancer une session interactive
ollama run deepseek-r1:7b

# Voir ce qui est chargé et où (GPU/CPU)
ollama ps
Terminal — REST-API-Aufruf
curl http://localhost:11434/api/generate -d '{
  "model": "deepseek-r1:7b",
  "prompt": "Explique la récursivité en une phrase.",
  "stream": false
}'

#Temperatur und Kontextfenster einstellen

Zwei Parameter beeinflussen die Qualität am stärksten: die Temperatur (Kreativität im Vergleich zu Determinismus) und num_ctx (Größe des Kontextfensters). Die Standardwerte von Ollama sind nicht immer ideal, besonders bei R1.

temperature (R1)
0,5 bis 0,7. DeepSeek empfiehlt etwa 0,6 für R1: Bei zu niedrigen Werten gerät das Schlussfolgern ins Stocken; bei zu hohen schweift das Modell ab. Vermeiden Sie 0 bei einem Reasoning-Modell.
temperature (Coder)
0,1 bis 0,3. Für Code wollen wir Determinismus und Wiederholbarkeit, nicht Kreativität.
num_ctx
Kontextgröße in Tokens. Der Standardwert liegt oft bei 4096. Erhöhen Sie ihn für lange Dateien oder lange Schlussfolgerungsketten auf 8192 oder 16384 – allerdings steigt dadurch der VRAM-Bedarf.
top_p
Etwa 0,95. Im Allgemeinen unverändert lassen; zuerst die Temperatur anpassen.
repeat_penalty
Standardwert: 1.1. Nützlich, wenn R1 in seiner Gedankenkette immer wieder dieselben Inhalte wiederholt.
Interaktive Sitzung – Einstellungen während der Sitzung anpassen
ollama run deepseek-r1:7b
>>> /set parameter temperature 0.6
>>> /set parameter num_ctx 8192
>>> Résous : un train part à 60 km/h...
>>> /bye
API — Parameter pro Anfrage
{
  "model": "deepseek-coder:6.7b",
  "prompt": "Écris une fonction Python de tri fusion.",
  "options": {
    "temperature": 0.2,
    "num_ctx": 8192,
    "top_p": 0.95
  },
  "stream": false
}
!
num_ctx kostet Speicher
Eine Verdopplung des Kontextfensters erhöht den vom KV-Cache belegten VRAM deutlich. Bei einer knapp dimensionierten Karte kann der Wechsel von 4096 auf 16384 dazu führen, dass ein Teil des Modells auf die CPU ausgelagert wird. Erhöhen Sie den Kontext nur, wenn Sie ihn tatsächlich benötigen.

#Die Konfiguration mit einem Modelfile festlegen

Das Einstellen der Parameter bei jeder Sitzung ist aufwendig. Ein Modelfile erstellt eine benannte Variante, die Ihre Einstellungen und einen Systemprompt enthält. Sie erhalten ein fertig konfiguriertes Modell, das wie jedes andere Modell aufgerufen werden kann.

Modelfile — deepseek-coder-fr
FROM deepseek-coder:6.7b

PARAMETER temperature 0.2
PARAMETER num_ctx 8192
PARAMETER top_p 0.95

SYSTEM """Tu es un assistant de programmation.
Réponds en français, commente le code, et privilégie la clarté."""
Terminal — Erstellen und Verwenden der Variante
# Créer le modèle à partir du fichier
ollama create deepseek-coder-fr -f ./Modelfile

# L'utiliser comme n'importe quel modèle
ollama run deepseek-coder-fr

Der gleiche Ansatz gilt für R1: Ein Modelfile mit temperature 0.6 und num_ctx 16384 liefert Ihnen ein abgestimmtes Reasoning-Modell, ohne dass Sie bei jedem Start daran denken müssen.

#VRAM und Speicher optimieren

Wenn ein Modell nicht vollständig in den VRAM passt, verlagert Ollama die überschüssigen Schichten auf die CPU — und die Anzahl der Tokens pro Sekunde bricht ein. Drei Stellschrauben, um vollständig auf der GPU zu bleiben.

Die Bitbreite der Quantisierung senken
Q4_K_M als Standard. Bleiben Sie dabei: Das ist bereits der richtige Kompromiss. Wechseln Sie nur zu Q5_K_M oder Q8_0, wenn der VRAM es zulässt und Sie eine etwas höhere Qualität anstreben.
Die passende Größe wählen
Ein 14B-Modell, das vollständig auf der GPU läuft, schlägt ein 32B-Modell, das teilweise auf die CPU ausgelagert wird – sowohl bei der Geschwindigkeit als auch beim Bedienkomfort. Wählen Sie das größte Modell, das vollständig in den VRAM passt.
num_ctx beherrschen
Der KV-Cache wächst mit dem Kontext. Eine angemessene Kontextgröße (8192) schafft Platz für die Modellgewichte.
Nach Gebrauch aus dem Speicher entladen
OLLAMA_KEEP_ALIVE legt fest, wie lange ein Modell nach der letzten Anfrage im Speicher bleibt. Verringern Sie den Wert, um die GPU beim Wechsel zwischen zwei Modellen schneller freizugeben.
Terminal — GPU schnell freigeben
# Garder les modèles chargés 2 minutes seulement (défaut : 5 min)
export OLLAMA_KEEP_ALIVE=2m

# Décharger immédiatement un modèle précis
ollama stop deepseek-r1:7b

#Parallele Ausführung und Nebenläufigkeit

Ollama kann mehrere Anfragen gleichzeitig verarbeiten und mehrere Modelle gleichzeitig geladen halten. Nützlich für einen gemeinsam genutzten Assistenten oder um Coder und R1 gleichzeitig zu betreiben. Zwei Umgebungsvariablen steuern dieses Verhalten.

OLLAMA_NUM_PARALLEL
Anzahl der Anfragen, die dasselbe Modell parallel verarbeitet. Jede Anfrage beansprucht ihren eigenen Anteil am Kontext und damit am VRAM. Erhöhen Sie den Wert je nach Grafikkarte vorsichtig (2, 4).
OLLAMA_MAX_LOADED_MODELS
Anzahl der verschiedenen Modelle, die gleichzeitig im Speicher gehalten werden. Erhöhen Sie den Wert auf 2, um Coder und R1 gleichzeitig geladen zu halten, sofern der VRAM ausreicht.
Terminal — mit paralleler Verarbeitung starten
# Servir 4 requêtes en parallèle, 2 modèles chargés
export OLLAMA_NUM_PARALLEL=4
export OLLAMA_MAX_LOADED_MODELS=2

# Redémarrer le service pour prendre en compte les variables
ollama serve
!
Der Parallelismus kostet VRAM
Jede parallele Anfrage und jedes geladene Modell benötigt eigenen Speicher. Auf einer knapp bemessenen Grafikkarte führt eine Erhöhung dieser Werte schnell dazu, dass Teile der Verarbeitung auf die CPU ausgelagert werden. Prüfen Sie dies mit `ollama ps`, nachdem Sie die Werte erhöht haben, und senken Sie sie wieder, wenn PROCESSOR nicht mehr 100% GPU anzeigt.

#Behebung häufiger Probleme

R1 hängt in einer Schleife innerhalb von <think> fest
Temperatur zu niedrig oder repeat_penalty fehlt. Erhöhen Sie temperature auf 0.6 und fügen Sie repeat_penalty 1.1 hinzu.
Sehr langsames Generieren
Das Modell wird teilweise auf der CPU ausgeführt. Prüfen Sie `ollama ps`: Wenn PROCESSOR nicht 100 % GPU anzeigt, reduzieren Sie die Modellgröße, die Quantisierungsstufe oder num_ctx.
Abgeschnittene Antwort
num_predict (maximale Anzahl generierter Tokens) zu niedrig oder Kontext ausgeschöpft. Erhöhen Sie num_ctx und lassen Sie num_predict unbegrenzt (-1).
Der Code wird mit Denkprozess-Markern geliefert
Sie verwenden R1 für Code. Wechseln Sie auf deepseek-coder, der keine Gedankenfolge erzeugt.

#Weiterführende Informationen

Nachdem DeepSeek konfiguriert und kalibriert ist, bieten sich folgende nächste Schritte an: sich eingehender mit R1 befassen, Ihre Varianten verfeinern und die Quantisierung passend zu Ihrer Grafikkarte wählen.

DeepSeek R1 mit Ollama installieren
Der eigene Leitfaden zum Reasoning-Modell, zu destillierten Versionen und zur Gedankenkette, um über die Konfiguration hinauszugehen.
Ein Modell mit Ollama Modelfile anpassen
Ein System aus Templates, System-Prompts und Parametern – um die hier gezeigten Varianten systematisch produktiv einzusetzen.
Quantisierung wählen (Q4, Q5, Q8, FP16)
Die Kompromisse zwischen Qualität und VRAM-Bedarf verstehen, um das größtmögliche DeepSeek-Modell im Speicher Ihrer GPU unterzubringen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.