Installieren von DeepSeek R1 mit Ollama
DeepSeek R1 ist ein von DeepSeek unter der MIT-Lizenz veröffentlichtes Reasoning-Modell mit Chain-of-Thought. Das vollständige Modell hat 671 Milliarden Parameter und lässt sich auf einem privaten Rechner nicht betreiben, doch die destillierten Versionen (1,5B bis 70B) passen problemlos auf handelsübliche Hardware. Dieses Tutorial zeigt, wie Sie DeepSeek R1 mit Ollama installieren, die richtige Größe wählen und den Reasoning-Modus nutzen.
#Warum DeepSeek R1?
R1 ist kein „klassisches“ LLM: Bevor es antwortet, erzeugt es eine sichtbare Gedankenkette, die von den Tags <think>...</think> eingerahmt wird. Diese Phase ermöglicht es ihm, Mathematik-, Logik- oder Programmierprobleme zu lösen, an denen Modelle mit direkter Generierung häufig scheitern. Bei AIME 2024 und MATH-500 schlagen die 14B- und 32B-Distillate Llama 3.1 70B Instruct deutlich, obwohl dieses Modell 2- bis 5-mal so groß ist.
Ein weiterer Vorteil: die MIT-Lizenz, ohne Einschränkungen bei der kommerziellen Nutzung oder hinsichtlich des geografischen Einsatzgebiets. Sie können R1 in ein Produkt, einen Agenten oder ein internes Tool integrieren, ohne jemanden um Erlaubnis bitten zu müssen. Das ist bei einem Reasoning-Modell auf diesem Niveau selten.
#Verfügbare destillierte Versionen
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Ollama bietet sieben Größen unter demselben Namen deepseek-r1 an. Der Standard-Tag verweist auf die destillierte 7B-Version (mit Qwen 7B als Basismodell).
- deepseek-r1:1.5b
- Auf Basis von Qwen 2.5 Math 1.5B. Leichtgewichtig, ideal zum Testen auf einem Laptop ohne GPU. Begrenzte Qualität bei komplexen Problemen.
- deepseek-r1:7b
- Basis: Qwen 2.5 Math 7B. Standard-Tag. Guter Kompromiss für 8 GB VRAM. Hervorragender Einstieg.
- deepseek-r1:8b
- Auf Basis von Llama 3.1 8B. Etwas gesprächiger als die 7B-Variante, besser auf Französisch.
- deepseek-r1:14b
- Auf Basis von Qwen 2.5 14B. Deutlicher Qualitätssprung bei mathematischen Aufgaben. Sweet Spot für 12 GB VRAM.
- deepseek-r1:32b
- Basis: Qwen 2.5 32B. Auf dem Niveau von o1-mini bei den meisten Reasoning-Benchmarks. Benötigt 24 GB VRAM in Q4.
- deepseek-r1:70b
- Basis Llama 3.3 70B. Der leistungsstärkste der Distillate. RTX 5090 32 GB oder Mac Studio 64 GB+.
- deepseek-r1:671b
- Das vollständige Modell (MoE 671B, 37B aktiv). Für einen gewöhnlichen Privatcomputer zu groß, aber auf einem Mac Studio Ultra mit 512 GB möglich.
#Voraussetzungen und VRAM je nach Modellgröße
Bevor Sie DeepSeek R1 mit Ollama installieren, stellen Sie sicher, dass Ollama installiert ist (der Daemon lauscht standardmäßig auf http://localhost:11434) und dass Ihre GPU ausreichend Speicher für die gewünschte Größe hat. Hier sind die VRAM-Anforderungen für die Quantisierung Q4_K_M, die standardmäßig von Ollama heruntergeladen wird.
- 1.5B Q4
- ~1,1 GB VRAM. Läuft auf jeder GPU oder sogar ausschließlich auf der CPU (15–25 tok/s).
- 7B Q4
- ~4,7 GB VRAM. RTX 3050 8 GB, 4060 8 GB, Mac M1/M2 16 GB.
- 8B Q4
- ~5,2 GB VRAM. Gleiche Zielgruppe wie beim 7B-Modell, weniger Speicherreserve bei 6 GB.
- 14B Q4
- ~9 GB VRAM. RTX 3060 12 GB, 4070 12 GB, M2 Pro 16 GB
- 32B Q4
- ~19 GB VRAM. RTX 3090/4090 24 GB, M3 Max 36 GB.
- 70B Q4
- ~40 GB VRAM. RTX 5090 32 GB mit Offload, Mac Studio Ultra 64 GB+.
#1. Das Modell installieren
Ein einziger Befehl genügt. Ollama lädt die Gewichte aus seiner offiziellen Registry herunter und lädt das Modell bei der ersten Verwendung in den Speicher.
Für eine bestimmte Größe fügen Sie das Tag hinzu:
Beim ersten Start wird das Modell heruntergeladen (von 1 GB für die 1.5B-Version bis zu 40 GB für die 70B-Version). Weitere Starts erfolgen sofort, solange das Modell im Cache von Ollama bleibt.
#2. Die Größe wählen
Die Wahl der Modellgröße hängt von drei Faktoren ab: dem VRAM, der Art der Aufgaben und Ihrer Toleranz gegenüber Wartezeiten. R1 erzeugt vor der endgültigen Antwort im Durchschnitt 500 bis 2000 Reasoning-Tokens — das sind also 3- bis 10-mal so viele Tokens wie bei einem klassischen Chatmodell mit direkter Generierung. Die Geschwindigkeit ist wirklich entscheidend.
- R1 ohne leistungsstarke GPU testen
- 1,5B oder 7B. Auch im CPU-Betrieb brauchbare Chat-Latenz.
- Mathematik auf Oberstufenniveau / einfache Python-Programmierung
- 7B oder 8B. In 80 % der Fälle ausreichend, bei fortgeschrittener Algebra enttäuschend.
- Anspruchsvolle Mathematik, Logik, lange Schlussfolgerungsketten
- Mindestens 14B. Deutlicher Sprung zwischen 8B und 14B bei AIME und MATH-500.
- Auf o1-mini-Niveau, komplexes Debugging, Demonstrationen
- 32B. Das ist die ideale Zielgröße, wenn Sie über 24 GB VRAM verfügen.
- Das lokal mögliche Maximum
- 70B Q4 auf einer RTX 5090 mit Offload oder einem Mac Studio mit mindestens 64 GB.
#3. Erster Reasoning-Prompt
R1 glänzt bei Problemen, die mehrere Schritte erfordern. Testen wir es an einer klassischen AIME-Aufgabe, die auch die 14B-Version bewältigen kann:
Beachten Sie die Struktur: Alles zwischen <think> und </think> ist die Gedankenkette des Modells. Sie können sie dem Endnutzer anzeigen, ausblenden oder zum Debuggen protokollieren. Das ist ein hervorragendes Mittel, um die Erklärbarkeit in einer App zu verbessern.
#4. Q4 vs Q8: Die Wahl der Quantisierung
Standardmäßig lädt Ollama Q4_K_M herunter (der empfohlene Kompromiss zwischen Qualität und Speicherbedarf). Bei Reasoning-Modellen bevorzugen manche die höhere Quantisierungsstufe Q8_0 – Qualitätsverluste in der Gedankenkette machen sich stärker bemerkbar als beim klassischen Chat.
- Q4_K_M
- Der Standardkompromiss. 2 bis 4 % weniger Qualität als FP16 bei Mathematik-Benchmarks. Diese Variante sollten Sie zuerst wählen.
- Q5_K_M
- +1 % Qualitätszuwachs im Vergleich zu Q4, +25 % Speicher. Interessant, wenn Sie ausreichend VRAM haben, aber die größere Version nicht nutzen können.
- Q8_0
- Qualität nahezu auf FP16-Niveau (-0,5 %). Doppelter Speicherbedarf gegenüber Q4. Empfohlen, wenn Sie beim 14B- oder 32B-Modell die bestmögliche Qualität wollen und genügend VRAM haben.
- FP16
- Genauere Referenz. Kein praktischer Vorteil gegenüber Q8 bei Distillaten und 4-mal schwerer als Q4.
#DeepSeek R1 vs Qwen 3.8 27B
Qwen 3.8 27B, am 14. August 2026 vom Qwen-Team veröffentlicht, ist das maßgebliche Open-Weight-Allzweckmodell des Jahres 2026: 262.000 Tokens Kontext, Bildverarbeitung, Apache-2.0-Lizenz und vor allem ein integrierter Reasoning-Modus. Es ist die naheliegende Alternative zu R1, wenn man ein einziges Modell möchte, das sowohl logisch schlussfolgern als auch alles andere erledigen kann. Welches sollten Sie wählen?
- DeepSeek R1 32B
- Spezialist für reines Schlussfolgern. Besser bei Mathematik-Benchmarks (AIME, MATH-500). Der Gedankengang ist stets sichtbar und lässt sich über <think>...</think> leicht parsen. Das Modell macht nur das, aber es macht es sehr gut.
- Qwen 3.8 27B
- Allround-Modell von 2026 mit integriertem Reasoning. Kontext 262k, Bildverarbeitung, Apache 2.0, ~18 GB in Q4. Standardmäßig denkt es zu viel nach: Selbst bei einer einfachen Frage erzeugt es eine lange, unnötige Gedankenkette. Stellen Sie die Reasoning-Stufe auf low, um wieder direkte Antworten zu erhalten.
- Praktisches Fazit
- R1 32B liegt bei reinen Mathematik- und Logikaufgaben sowie bei einem stabilen, protokollierbaren Format für die Denkschritte weiterhin vorn. Qwen 3.8 27B gewinnt, sobald Sie ein vielseitiges Modell (Code, Chat, Bildverarbeitung, langer Kontext) wollen, das bei Bedarf logisch schlussfolgert. Für Französisch sind beide solide.
- Ressourcen
- Vergleichbar. R1 32B passt in Q4 in 24 GB (RTX 3090/4090). Qwen 3.8 27B ist etwas leichter (~18 GB in Q4) und lässt auf derselben Karte mehr Spielraum für den Kontext.
#Fehlerbehebung
- Modell, das <think> nicht anzeigt
- Sie verwenden möglicherweise einen Client, der XML-Labels verdeckt. Testen Sie mit ollama run en CLI, um zu überprüfen, ob das Modell diese korrekt erzeugt. Wenn die API JSON diese abschneidet, liegt der Fehler im Client.
- Abgeschnittene Antworten
- Die standardmäßige Kontextgröße von Ollama beträgt 4096 Tokens. R1 verbraucht viele davon für seinen Denkprozess. Erhöhen Sie die Kontextgröße mit /set parameter num_ctx 16384 in der Sitzung oder über den Parameter options.num_ctx in der API.
- Sehr langsam trotz einer guten GPU
- Prüfen Sie mit ollama ps, ob das Modell zu 100 % auf der GPU läuft. Wenn die Spalte PROCESSOR CPU anzeigt, werden Teile des Modells in den Arbeitsspeicher ausgelagert. Wählen Sie ein kleineres Modell oder wechseln Sie zu einer aggressiveren Quantisierung.
- Das Modell gerät in seiner Gedankenkette in eine Schleife
- Das ist typisch für kleine destillierte Modelle (1,5B, 7B) bei zu schwierigen Problemen. Verwenden Sie entweder ein größeres Modell, stellen Sie eine einfachere Aufgabe oder ergänzen Sie Ihren Prompt um „Antworte mit weniger als 500 Tokens für den Denkprozess“.
- Fehler „insufficient memory“
- Das Modell ist zu groß für Ihren VRAM. ollama rm deepseek-r1:32b, dann ollama pull deepseek-r1:14b. Sie können auch mit OLLAMA_GPU_LAYERS einen teilweisen Offload erzwingen.
#Weiterführende Informationen
Einige sinnvolle nächste Schritte nach dieser Installation:
- Quantisierungen verstehen
- Der Q4/Q5/Q8-Leitfaden dieser Website erläutert die genauen Kompromisse und ist hilfreich, bevor Sie zu einem größeren Modell wechseln.
- Eine GPU für R1 auswählen
- Wenn Sie ernsthaft die 32B-Version einsetzen möchten, nennt der GPU-Kaufratgeber die Speicherschwellen von 24/32 GB, die Sie 2026 anstreben sollten.
- R1 mit einer Schnittstelle verbinden
- Open WebUI oder LM Studio unterstützen die Tags <think> nativ und ermöglichen es, die Gedankengänge ein- und auszuklappen.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.