DeepSeek V4 Pro im Vergleich zu Flash: Welche Version lokal? ?
DeepSeek V4 Pro und DeepSeek V4 Flash sind am selben Tag unter derselben MIT-Lizenz und mit derselben MoE-Architektur erschienen. Und dennoch: 1,6 Billionen Parameter gegenüber 284 Milliarden, 960 GB VRAM bei Q4 gegenüber 170 GB, ein H200-Cluster gegenüber einem Mac Studio. Die Wahl zwischen den beiden ist keine Frage der Qualität – sondern der Hardware und des Einsatzzwecks. Dieser Vergleich von DeepSeek V4 Pro und Flash für den lokalen Betrieb hilft Ihnen bei der Entscheidung, bevor Sie umsonst 960 GB herunterladen.
#Pro und Flash: Was sie wirklich voneinander unterscheidet
Die beiden Modelle haben die wesentlichen Merkmale gemeinsam: MoE-Architektur mit hybrider Attention CSA+HCA, natives Kontextfenster mit 1 Million Tokens, drei Thinking-Modi (Non / High / Max), permissive MIT-Lizenz, Vortraining mit Muon+FP4. Der Unterschied liegt in einer einzigen Zahl: der Größe des Expertenpools.
- V4 Pro
- 1,6 Billionen Parameter insgesamt, 49 Milliarden aktive Parameter pro Token, 256 Experten mit Top-8-Auswahl. Das vollständige Frontier-Modell.
- V4 Flash
- 284 Milliarden Parameter insgesamt, 13 Milliarden aktive Parameter pro Token, 64 Experten mit Top-8-Auswahl. Dieselbe Architektur, komprimiert.
- Was identisch ist
- Vokabular, Tokenizer, Chat-Vorlage, Thinking-Modi, Kontextlänge (1M), Lizenz MIT, Installationsskripte für llama.cpp / vLLM.
- Was sich wirklich ändert
- Gesamte VRAM-Kapazität, Durchsatz in Tokens/s, Ergebnisse bei Benchmarks für extrem anspruchsvolles Schlussfolgern (AIME, GPQA Max). Bei alltäglichen Aufgaben ist der Unterschied geringer als erwartet.
#1. Die VRAM-Schwellen, je nach Version
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
Dieses Kriterium entscheidet über fast alles. Hier sind die gemessenen Schwellenwerte für den gesamten VRAM-Bedarf, einschließlich des geladenen Modells und des KV-Caches für 32k Tokens (nicht 1M):
#DeepSeek V4 Pro 1.6T
- Q8_0
- ≈ 1 800 GB. Cluster 8× H200 141GB erforderlich. Kein lokales Single-Machine-Szenario.
- Q5_K_M
- ≈ 1 230 GB. 3 Mac Studio mit jeweils 512 GB im RPC-Swarm oder 4× H200.
- Q4_K_M (empfohlen)
- ≈ 1.040 GB. 8× A100 80GB in Tensor-Parallelismus oder 2× Mac Studio 512 GB im Network Swarm mit llama.cpp.
- IQ3_M
- ≈ 800 GB. Ein einzelner Mac Studio mit 512 GB + teilweise Auslagerung auf SSD. Sehr langsam (~2–4 Tok/s), verminderte Qualität.
- IQ2_XS
- ≈ 560 GB. Einzelner Mac Studio 512 GB. Hohe Qualitätsverluste — nicht empfohlen.
#DeepSeek V4 Flash 284B
- FP16
- ≈ 570 GB. H100/H200-Cluster oder Mac Studio 512 + NVIDIA-Workstation im Swarm.
- Q8_0
- ≈ 305 GB. Mac Studio M3 Ultra mit 512 GB allein oder 4× RTX 6000 Ada mit 48 GB.
- Q5_K_M
- ≈ 210 GB. Mac Studio Ultra 256 GB (an der Grenze) oder 3× RTX 4090 24 GB + Offload
- Q4_K_M (empfohlen)
- ≈ 170 GB. Ein einzelner Mac Studio M2 Ultra mit 192 GB, 2× A6000 mit je 48 GB oder 4× RTX 4090 mit je 24 GB.
- IQ3_M
- ≈ 130 GB. 2× RTX 4090 24GB + Auslagerung in den RAM, oder Mac Studio mit 128 GB.
#2. Tatsächliche GPU-Kosten pro Version
Die Zahlen unten sind Hardware-Kaufbudgets, ohne Stromkosten, basierend auf den Preisen vom Mai 2026.
#Um V4 Pro (Q4 ~1 040 GB) zu betreiben
- Cluster 8× H200 141GB
- ≈ 280.000 € für Hardware und Server, ≈ 320.000 € inklusive Installation. Ein „sauberes“ vLLM-Setup mit nativem FP8.
- Cluster mit 8× gebrauchten A100 80GB
- ≈ 90.000 € für die Hardware, mit Gehäuse ≈ 110.000 €. Tensor-Parallelismus mit 640 GB VRAM. Erschwinglicher, aber langsamer.
- Swarm 2× Mac Studio M3 Ultra 512 GB
- ≈ 28.000 € zu den Preisen vom Mai 2026 (der M3 Ultra wird nicht mehr neu verkauft; M5 Ultra mit 512 GB Ende Oktober 2026 angekündigt). Die günstigste lokale Lösung für Pro Q4. Bescheidener, aber tatsächlich erreichbarer Durchsatz (5–8 tok/s), mit llama.cpp RPC über 10 GbE.
- Miete einer vergleichbaren Cloud-Konfiguration
- ≈ 60 €/h bei Lambda/Crusoe für 8× H200. Wird gegenüber dem Kauf nach insgesamt mehr als etwa 5.500 Stunden wirtschaftlich.
#Um V4 Flash (Q4 ~170 GB) zu betreiben
- Mac Studio M2 Ultra 192 GB
- ≈ 4 200 € reconditioniert (kein neuer Verkauf mehr). Kurzeste Solo-Route.
- Mac Studio M3 Ultra 256 GB
- Wird von Apple nicht mehr neu verkauft (durch den M5 Ultra ersetzt, der mit 256 GB erhältlich ist); gebraucht suchen, Preise variieren. Mehr Spielraum für lange Kontexte und den Thinking-Modus Max.
- 4× RTX 4090 24GB Workstation
- Gebrauchte GPUs (RTX 4090, Preis variabel) + ca. 4.500 € (Gehäuse/Netzteil/CPU). Rein CUDA-basiert, vLLM möglich.
- 2× RTX 6000 Ada 48GB
- Preis prüfen (professionelle Grafikkarte, deren Preis nicht verfolgt wird). Aufgeräumtere Lösung als 4× 4090, weniger laut.
- Miete einer vergleichbaren Cloud-Konfiguration
- ≈ 4 €/h bei Hyperstack/Lambda für 4× A100 80GB. Ab etwa 1.600 kumulierten Betriebsstunden gegenüber einem Mac Studio rentabel.
#3. Latenz und Durchsatz im Vergleich
Hier sind die gemessenen Werte bei deaktiviertem Thinking-Modus, einem Kontext von 8k Tokens, einem Prompt von 500 Tokens und einer Generierung von 1.000 Tokens. Die Messwerte stammen aus dem DeepSeek-Paper und Community-Benchmarks vom Mai 2026.
#V4 Pro Q4_K_M
- Cluster 8× H200 (vLLM FP8)
- TTFT ~0,8s · Durchsatz 38 Tok/s · 1000 Tokens in ~27s
- Cluster mit 8× A100 80GB (vLLM Q4)
- TTFT ~1,4s · Durchsatz 22 Tok/s · 1000 Tokens in ~47s.
- Swarm 2× Mac Studio M3 Ultra 512 (llama.cpp RPC)
- TTFT ~6 s · Durchsatz 6 tok/s · 1000 Tokens in ~3 Min. Der durch RPC über das Netzwerk verursachte Geschwindigkeitsverlust dominiert.
#V4 Flash Q4_K_M
- Mac Studio M3 Ultra 256 GB (MLX)
- TTFT ~0,4s · Durchsatz 28 Tok/s · 1000 Tokens in ~36s. Der ideale Punkt für Einzelnutzung.
- Mac Studio M2 Ultra 192 GB (llama.cpp)
- TTFT ~0,6s · Durchsatz 14 Tok/s · 1000 Tokens in ~72s.
- 4× RTX 4090 24GB (vLLM)
- TTFT ~0,3 s · Durchsatz 52 tok/s · 1000 Tokens in ~19 s. Lokal am schnellsten.
- 2× A6000 48GB (vLLM)
- TTFT ~0,4s · Durchsatz 38 Tok/s · 1000 Tokens in ~26s.
#4. Entscheidungsbaum basierend auf Ihrem Hardware-Setup
Fünf Fragen, ein Urteil. Lesen Sie von oben nach unten und hören Sie bei der ersten Antwort auf.
- 01GPU-Budget > 200.000 € und Bedarf an kompromissloser Frontier-KI?→ DeepSeek V4 Pro Q4 auf einem Cluster mit 8× H200 oder 8× A100. Sie sind eine Bank, ein Labor oder eine souveräne Verwaltung. Dies ist das einzige Szenario, in dem Pro sinnvoll ist.
- 02Sie besitzen oder planen 2× Mac Studio M3 Ultra 512 GB (preis variabel, zu überprüfen) und akzeptieren 5–8 Tok/s?→ V4 Pro Q4 über llama.cpp RPC ist möglich. Nutzen Sie das ausschließlich für nächtliche Batchverarbeitung, niemals für interaktive Nutzung. Andernfalls gehen Sie zum nächsten Schritt.
- 03Besitzen Sie einen Mac Studio Ultra der Spitzenklasse (heute mit anderen Speicherausstattungen; Preise sind zu prüfen)?→ V4 Flash Q4 mit MLX oder llama.cpp. 12–28 Tok/s je nach Generation. Die beste Erfahrung für Einzelnutzer im Jahr 2026.
- 04Besitzen Sie 2 bis 4 NVIDIA-GPUs mit insgesamt >80 GB VRAM?→ V4 Flash Q4 mit vLLM (vorzuziehen) oder llama.cpp. Höherer Durchsatz als beim Mac Studio, aber mehr Lärm, höherer Stromverbrauch und größerer Platzbedarf.
- 05Haben Sie weniger als 80 GB VRAM (eine einzelne RTX 4090 usw.)?→ Weder Pro noch Flash in Q4. Schauen Sie sich die geplanten Flash→32B-Destillationen an oder greifen Sie bis dahin auf DeepSeek V3.5 32B / Qwen3.6 35B-A3B zurück.
#5. Für welchen Einsatzzweck welches der beiden Modelle wählen
Öffentliche Benchmark-Daten sagen nicht alles. Hier ist die ehrliche Bewertung nach Nutzungskategorie.
- Allgemeiner Chat-Assistent, Übersetzung, Zusammenfassung
- Flash reicht völlig aus. Der Unterschied zu Pro beträgt dabei 2–4 Punkte und ist in der Praxis nicht wahrnehmbar. Geben Sie dem Durchsatz Vorrang.
- Code (Generierung, Refactoring, Debugging)
- Flash im High-Modus liegt sehr nahe an Pro Non. Bei komplexem Debugging behält Pro Max den Vorteil — allerdings mit einer Wartezeit von 10 Minuten pro Antwort.
- Mathematik, Beweis, AIME/GPQA
- Pro Max liegt je nach Schwierigkeit 8 bis 15 Punkte vor Flash Max. Das ist der Anwendungsfall, in dem sich der Einsatz von Pro wirklich rechtfertigt.
- Analyse von langen Dokumenten (>200k Tokens)
- Technischer Gleichstand (beide unterstützen 1 Million Tokens). Der Unterschied wird hauptsächlich durch die CSA-Attention bestimmt, die bei beiden identisch ist. Nach dem verfügbaren VRAM für den KV-Cache auswählen.
- Agenten mit Tool-Aufruf
- Flash reicht aus. Tool Calling wird durch das Chat-Template und das Instruct-Fine-Tuning gesteuert, nicht durch die Modellgröße.
- Lokales Fine-Tuning (LoRA)
- Flash ist auf 2× H100 möglich. Pro ist für lokale LoRA-Trainings außer Reichweite – ein Trainingscluster ist erforderlich.
#Tipps und Stolperfallen
- Quantisierung des KV-Caches
- Bei beiden Modellen – cache-type-k q8_0 --cache-type-v q8_0 (llama.cpp) oder --kv-cache-dtype fp8 (vLLM) – wird die KV-Speicherung durch 2 geteilt, wobei die Qualitätsverluste praktisch null sind. Erforderlich ab einem Kontext von 64k.
- Flash Attention erforderlich
- Aktivieren Sie -fa (llama.cpp) oder --enable-flash-attn (vLLM). Andernfalls sinkt der Durchsatz um 30 % und der Speicherbedarf steigt bei Kontextlängen über 32k Tokens drastisch an.
- Thinking-Modus als Standard
- Lassen Sie bei beiden Modellen den Max-Modus niemals standardmäßig aktiviert – ein Agent in einer Endlosschleife kann stundenlang nachdenken. Explizit über /think oder /think_max umschalten.
- Multi-GPU mit Pro: Pipeline-Parallelisierung vermeiden
- Auf einem H200-Cluster: Tensorparallelismus über 8 GPUs. Pipelineparallelismus verursacht zusätzliche Latenz zwischen den Schichten, die bei einem MoE-Modell mit 1,6T dominiert. vLLM übernimmt das automatisch mit --tensor-parallel-size 8.
- Mac-Studio-Swarm: mindestens 10 GbE
- RPC in llama.cpp überträgt viele Zwischentensoren. Bei 1 GbE fällt der Durchsatz von Pro unter 1 Tok/s. Planen Sie einen 10-GbE-Switch und SFP+-Kabel ein.
- Exakt identische Chat-Vorlagen
- Pro und Flash verwenden dasselbe Format. Ein Skript, das für die eine Variante funktioniert, funktioniert auch für die andere – nützlich für A/B-Tests, ohne Ihren Anwendungscode neu schreiben zu müssen.
#Weiterführende Informationen
Wenn Sie sich für eine Version entschieden haben, finden Sie hier die Anleitungen zur Umsetzung:
- DeepSeek V4 Pro 1.6T: Architektur, Installation, Benchmarks
- Die Cluster-Installationsanleitung für diejenigen, die sich für Pro entschieden haben.
- DeepSeek V4 Flash 284B: Das erste Frontier-Modell, das auf dem Mac Studio läuft
- Schritt-für-Schritt-Installation auf dem Mac Studio Ultra und detaillierte Benchmarks.
- Welches LLM auf dem Mac Studio (M2/M3/M4 Ultra, 64–512 GB)?
- Um die Mac-Studio-Konfiguration auf Ihr Budget abzustimmen.
- Multi-GPU-Setup mit llama.cpp
- Die Referenz für die lokale Einrichtung von 2 bis 4 NVIDIA-GPUs ohne Einbußen bei den Tokens pro Sekunde.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.