Einsteiger 8 minOllama

Installieren von DeepSeek R1 mit Ollama

DeepSeek R1 ist ein von DeepSeek unter der MIT-Lizenz veröffentlichtes Reasoning-Modell mit Chain-of-Thought. Das vollständige Modell hat 671 Milliarden Parameter und lässt sich auf einem privaten Rechner nicht betreiben, doch die destillierten Versionen (1,5B bis 70B) passen problemlos auf handelsübliche Hardware. Dieses Tutorial zeigt, wie Sie DeepSeek R1 mit Ollama installieren, die richtige Größe wählen und den Reasoning-Modus nutzen.

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum DeepSeek R1?

R1 ist kein „klassisches“ LLM: Bevor es antwortet, erzeugt es eine sichtbare Gedankenkette, die von den Tags <think>...</think> eingerahmt wird. Diese Phase ermöglicht es ihm, Mathematik-, Logik- oder Programmierprobleme zu lösen, an denen Modelle mit direkter Generierung häufig scheitern. Bei AIME 2024 und MATH-500 schlagen die 14B- und 32B-Distillate Llama 3.1 70B Instruct deutlich, obwohl dieses Modell 2- bis 5-mal so groß ist.

Ein weiterer Vorteil: die MIT-Lizenz, ohne Einschränkungen bei der kommerziellen Nutzung oder hinsichtlich des geografischen Einsatzgebiets. Sie können R1 in ein Produkt, einen Agenten oder ein internes Tool integrieren, ohne jemanden um Erlaubnis bitten zu müssen. Das ist bei einem Reasoning-Modell auf diesem Niveau selten.

i
Destillation, kurz erklärt
Das vollständige R1-Modell (671B MoE) hat Millionen von Beispielen für logisches Schlussfolgern erzeugt, die anschließend für das Fine-Tuning kleinerer Modelle verwendet wurden (Qwen 7B/14B/32B und Llama 8B/70B). Die destillierten Modelle sind daher nicht R1 selbst, sondern Qwen- und Llama-Modelle, die gelernt haben, wie R1 logisch zu schlussfolgern.

#Verfügbare destillierte Versionen

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Ollama bietet sieben Größen unter demselben Namen deepseek-r1 an. Der Standard-Tag verweist auf die destillierte 7B-Version (mit Qwen 7B als Basismodell).

deepseek-r1:1.5b
Auf Basis von Qwen 2.5 Math 1.5B. Leichtgewichtig, ideal zum Testen auf einem Laptop ohne GPU. Begrenzte Qualität bei komplexen Problemen.
deepseek-r1:7b
Basis: Qwen 2.5 Math 7B. Standard-Tag. Guter Kompromiss für 8 GB VRAM. Hervorragender Einstieg.
deepseek-r1:8b
Auf Basis von Llama 3.1 8B. Etwas gesprächiger als die 7B-Variante, besser auf Französisch.
deepseek-r1:14b
Auf Basis von Qwen 2.5 14B. Deutlicher Qualitätssprung bei mathematischen Aufgaben. Sweet Spot für 12 GB VRAM.
deepseek-r1:32b
Basis: Qwen 2.5 32B. Auf dem Niveau von o1-mini bei den meisten Reasoning-Benchmarks. Benötigt 24 GB VRAM in Q4.
deepseek-r1:70b
Basis Llama 3.3 70B. Der leistungsstärkste der Distillate. RTX 5090 32 GB oder Mac Studio 64 GB+.
deepseek-r1:671b
Das vollständige Modell (MoE 671B, 37B aktiv). Für einen gewöhnlichen Privatcomputer zu groß, aber auf einem Mac Studio Ultra mit 512 GB möglich.

#Voraussetzungen und VRAM je nach Modellgröße

Bevor Sie DeepSeek R1 mit Ollama installieren, stellen Sie sicher, dass Ollama installiert ist (der Daemon lauscht standardmäßig auf http://localhost:11434) und dass Ihre GPU ausreichend Speicher für die gewünschte Größe hat. Hier sind die VRAM-Anforderungen für die Quantisierung Q4_K_M, die standardmäßig von Ollama heruntergeladen wird.

1.5B Q4
~1,1 GB VRAM. Läuft auf jeder GPU oder sogar ausschließlich auf der CPU (15–25 tok/s).
7B Q4
~4,7 GB VRAM. RTX 3050 8 GB, 4060 8 GB, Mac M1/M2 16 GB.
8B Q4
~5,2 GB VRAM. Gleiche Zielgruppe wie beim 7B-Modell, weniger Speicherreserve bei 6 GB.
14B Q4
~9 GB VRAM. RTX 3060 12 GB, 4070 12 GB, M2 Pro 16 GB
32B Q4
~19 GB VRAM. RTX 3090/4090 24 GB, M3 Max 36 GB.
70B Q4
~40 GB VRAM. RTX 5090 32 GB mit Offload, Mac Studio Ultra 64 GB+.
→
Unsicher, wie viel VRAM Ihnen zur Verfügung steht?
Öffnen Sie unter Windows den Task-Manager und wechseln Sie zum Reiter Leistung > GPU. Unter Linux: nvidia-smi für NVIDIA, rocm-smi für AMD. Auf dem Mac ist der Speicher vereinheitlicht; rechnen Sie mit etwa 75 % des gesamten RAM als für das LLM nutzbarem VRAM.

#1. Das Modell installieren

Ein einziger Befehl genügt. Ollama lädt die Gewichte aus seiner offiziellen Registry herunter und lädt das Modell bei der ersten Verwendung in den Speicher.

Die 7B-Version standardmäßig installieren
ollama run deepseek-r1

Für eine bestimmte Größe fügen Sie das Tag hinzu:

Explizit eine Größe auswählen
# Version la plus légère (1.5B)
ollama run deepseek-r1:1.5b

# Sweet spot 12 Go VRAM
ollama run deepseek-r1:14b

# Pour RTX 3090/4090
ollama run deepseek-r1:32b

Beim ersten Start wird das Modell heruntergeladen (von 1 GB für die 1.5B-Version bis zu 40 GB für die 70B-Version). Weitere Starts erfolgen sofort, solange das Modell im Cache von Ollama bleibt.

!
Kein :cloud, niemals
Wenn Sie irgendwo deepseek-r1:cloud sehen, ignorieren Sie diesen Tag: Er leitet Anfragen an die Server von Ollama Cloud weiter, wobei nach Nutzung abgerechnet wird. Um ausschließlich selbst zu hosten, verwenden Sie nur die nummerierten Tags (1.5b, 7b, 14b, 32b, 70b).

#2. Die Größe wählen

Die Wahl der Modellgröße hängt von drei Faktoren ab: dem VRAM, der Art der Aufgaben und Ihrer Toleranz gegenüber Wartezeiten. R1 erzeugt vor der endgültigen Antwort im Durchschnitt 500 bis 2000 Reasoning-Tokens — das sind also 3- bis 10-mal so viele Tokens wie bei einem klassischen Chatmodell mit direkter Generierung. Die Geschwindigkeit ist wirklich entscheidend.

R1 ohne leistungsstarke GPU testen
1,5B oder 7B. Auch im CPU-Betrieb brauchbare Chat-Latenz.
Mathematik auf Oberstufenniveau / einfache Python-Programmierung
7B oder 8B. In 80 % der Fälle ausreichend, bei fortgeschrittener Algebra enttäuschend.
Anspruchsvolle Mathematik, Logik, lange Schlussfolgerungsketten
Mindestens 14B. Deutlicher Sprung zwischen 8B und 14B bei AIME und MATH-500.
Auf o1-mini-Niveau, komplexes Debugging, Demonstrationen
32B. Das ist die ideale Zielgröße, wenn Sie über 24 GB VRAM verfügen.
Das lokal mögliche Maximum
70B Q4 auf einer RTX 5090 mit Offload oder einem Mac Studio mit mindestens 64 GB.
→
Einfache Regel
Beginnen Sie mit der 14B, wenn Sie 12 GB VRAM haben. Dies ist der Punkt, an dem R1 wirklich interessant wird. Die 7B dient vor allem zum Einarbeiten.

#3. Erster Reasoning-Prompt

R1 glänzt bei Problemen, die mehrere Schritte erfordern. Testen wir es an einer klassischen AIME-Aufgabe, die auch die 14B-Version bewältigen kann:

Beispiel Mathematik
>>> Un train part de Lyon à 8h à 90 km/h vers Paris.
... Un autre part de Paris à 9h à 110 km/h vers Lyon.
... La distance Lyon-Paris est 460 km. À quelle heure se croisent-ils ?

<think>
À 9h, le premier train a parcouru 90 km. Il reste 460 - 90 = 370 km
entre les deux trains. Ils se rapprochent à 90 + 110 = 200 km/h.
Temps avant croisement : 370 / 200 = 1,85 h = 1h51min.
Donc croisement à 9h + 1h51 = 10h51.
</think>

Les deux trains se croisent à 10h51.

Beachten Sie die Struktur: Alles zwischen <think> und </think> ist die Gedankenkette des Modells. Sie können sie dem Endnutzer anzeigen, ausblenden oder zum Debuggen protokollieren. Das ist ein hervorragendes Mittel, um die Erklärbarkeit in einer App zu verbessern.

i
Löschen Sie <think> nicht
Eine typische Versuchung: einen System-Prompt hinzufügen, der sagt: „Erzeuge keine Gedankenkette“. Eine schlechte Idee: Die Qualität bricht ein. Das Reasoning IST das Modell. Blenden Sie den Block in der Benutzeroberfläche aus, statt ihn bei der Generierung zu entfernen.

#4. Q4 vs Q8: Die Wahl der Quantisierung

Standardmäßig lädt Ollama Q4_K_M herunter (der empfohlene Kompromiss zwischen Qualität und Speicherbedarf). Bei Reasoning-Modellen bevorzugen manche die höhere Quantisierungsstufe Q8_0 – Qualitätsverluste in der Gedankenkette machen sich stärker bemerkbar als beim klassischen Chat.

Quantisierungs-Tags in Ollama
# Q4_K_M (défaut) — recommandé pour 80 % des cas
ollama pull deepseek-r1:14b

# Q8_0 — qualité maximale, mémoire doublée
ollama pull deepseek-r1:14b-q8_0

# Liste complète des tags disponibles
ollama show deepseek-r1:14b --modelfile
Q4_K_M
Der Standardkompromiss. 2 bis 4 % weniger Qualität als FP16 bei Mathematik-Benchmarks. Diese Variante sollten Sie zuerst wählen.
Q5_K_M
+1 % Qualitätszuwachs im Vergleich zu Q4, +25 % Speicher. Interessant, wenn Sie ausreichend VRAM haben, aber die größere Version nicht nutzen können.
Q8_0
Qualität nahezu auf FP16-Niveau (-0,5 %). Doppelter Speicherbedarf gegenüber Q4. Empfohlen, wenn Sie beim 14B- oder 32B-Modell die bestmögliche Qualität wollen und genügend VRAM haben.
FP16
Genauere Referenz. Kein praktischer Vorteil gegenüber Q8 bei Distillaten und 4-mal schwerer als Q4.
→
Q4 14B > Q8 7B
Wenn Sie zwischen einer höheren Quantisierungspräzision und einem größeren Modell schwanken, wählen Sie immer das größere Modell. Ein 14B-Modell in Q4 schlägt beim logischen Schlussfolgern durchweg ein 7B-Modell in Q8, bei ungefähr gleichem VRAM-Bedarf.

#DeepSeek R1 vs Qwen 3.8 27B

Qwen 3.8 27B, am 14. August 2026 vom Qwen-Team veröffentlicht, ist das maßgebliche Open-Weight-Allzweckmodell des Jahres 2026: 262.000 Tokens Kontext, Bildverarbeitung, Apache-2.0-Lizenz und vor allem ein integrierter Reasoning-Modus. Es ist die naheliegende Alternative zu R1, wenn man ein einziges Modell möchte, das sowohl logisch schlussfolgern als auch alles andere erledigen kann. Welches sollten Sie wählen?

DeepSeek R1 32B
Spezialist für reines Schlussfolgern. Besser bei Mathematik-Benchmarks (AIME, MATH-500). Der Gedankengang ist stets sichtbar und lässt sich über <think>...</think> leicht parsen. Das Modell macht nur das, aber es macht es sehr gut.
Qwen 3.8 27B
Allround-Modell von 2026 mit integriertem Reasoning. Kontext 262k, Bildverarbeitung, Apache 2.0, ~18 GB in Q4. Standardmäßig denkt es zu viel nach: Selbst bei einer einfachen Frage erzeugt es eine lange, unnötige Gedankenkette. Stellen Sie die Reasoning-Stufe auf low, um wieder direkte Antworten zu erhalten.
Praktisches Fazit
R1 32B liegt bei reinen Mathematik- und Logikaufgaben sowie bei einem stabilen, protokollierbaren Format für die Denkschritte weiterhin vorn. Qwen 3.8 27B gewinnt, sobald Sie ein vielseitiges Modell (Code, Chat, Bildverarbeitung, langer Kontext) wollen, das bei Bedarf logisch schlussfolgert. Für Französisch sind beide solide.
Ressourcen
Vergleichbar. R1 32B passt in Q4 in 24 GB (RTX 3090/4090). Qwen 3.8 27B ist etwas leichter (~18 GB in Q4) und lässt auf derselben Karte mehr Spielraum für den Kontext.
i
Beide zu testen geht schnell
ollama pull qwen3.8:27b à côté de deepseek-r1:32b, puis comparez sur vos vrais prompts. Pensez à baisser le niveau de raisonnement de Qwen 3.8 en low si vous le trouvez trop bavard. C'est l'arbitrage le plus fiable — vos cas d'usage valent mieux que n'importe quel benchmark public.

#Fehlerbehebung

Modell, das <think> nicht anzeigt
Sie verwenden möglicherweise einen Client, der XML-Labels verdeckt. Testen Sie mit ollama run en CLI, um zu überprüfen, ob das Modell diese korrekt erzeugt. Wenn die API JSON diese abschneidet, liegt der Fehler im Client.
Abgeschnittene Antworten
Die standardmäßige Kontextgröße von Ollama beträgt 4096 Tokens. R1 verbraucht viele davon für seinen Denkprozess. Erhöhen Sie die Kontextgröße mit /set parameter num_ctx 16384 in der Sitzung oder über den Parameter options.num_ctx in der API.
Sehr langsam trotz einer guten GPU
Prüfen Sie mit ollama ps, ob das Modell zu 100 % auf der GPU läuft. Wenn die Spalte PROCESSOR CPU anzeigt, werden Teile des Modells in den Arbeitsspeicher ausgelagert. Wählen Sie ein kleineres Modell oder wechseln Sie zu einer aggressiveren Quantisierung.
Das Modell gerät in seiner Gedankenkette in eine Schleife
Das ist typisch für kleine destillierte Modelle (1,5B, 7B) bei zu schwierigen Problemen. Verwenden Sie entweder ein größeres Modell, stellen Sie eine einfachere Aufgabe oder ergänzen Sie Ihren Prompt um „Antworte mit weniger als 500 Tokens für den Denkprozess“.
Fehler „insufficient memory“
Das Modell ist zu groß für Ihren VRAM. ollama rm deepseek-r1:32b, dann ollama pull deepseek-r1:14b. Sie können auch mit OLLAMA_GPU_LAYERS einen teilweisen Offload erzwingen.

#Weiterführende Informationen

Einige sinnvolle nächste Schritte nach dieser Installation:

Quantisierungen verstehen
Der Q4/Q5/Q8-Leitfaden dieser Website erläutert die genauen Kompromisse und ist hilfreich, bevor Sie zu einem größeren Modell wechseln.
Eine GPU für R1 auswählen
Wenn Sie ernsthaft die 32B-Version einsetzen möchten, nennt der GPU-Kaufratgeber die Speicherschwellen von 24/32 GB, die Sie 2026 anstreben sollten.
R1 mit einer Schnittstelle verbinden
Open WebUI oder LM Studio unterstützen die Tags <think> nativ und ermöglichen es, die Gedankengänge ein- und auszuklappen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.