Fortgeschritten 12 Min.DeepSeek

DeepSeek V4 Pro im Vergleich zu Flash: Welche Version lokal? ?

DeepSeek V4 Pro und DeepSeek V4 Flash sind am selben Tag unter derselben MIT-Lizenz und mit derselben MoE-Architektur erschienen. Und dennoch: 1,6 Billionen Parameter gegenüber 284 Milliarden, 960 GB VRAM bei Q4 gegenüber 170 GB, ein H200-Cluster gegenüber einem Mac Studio. Die Wahl zwischen den beiden ist keine Frage der Qualität – sondern der Hardware und des Einsatzzwecks. Dieser Vergleich von DeepSeek V4 Pro und Flash für den lokalen Betrieb hilft Ihnen bei der Entscheidung, bevor Sie umsonst 960 GB herunterladen.

Von Mohamed Meguedmi·Aktualisierung 2026-06-03·Unter Windows, macOS und Linux getestet

#Pro und Flash: Was sie wirklich voneinander unterscheidet

Die beiden Modelle haben die wesentlichen Merkmale gemeinsam: MoE-Architektur mit hybrider Attention CSA+HCA, natives Kontextfenster mit 1 Million Tokens, drei Thinking-Modi (Non / High / Max), permissive MIT-Lizenz, Vortraining mit Muon+FP4. Der Unterschied liegt in einer einzigen Zahl: der Größe des Expertenpools.

V4 Pro
1,6 Billionen Parameter insgesamt, 49 Milliarden aktive Parameter pro Token, 256 Experten mit Top-8-Auswahl. Das vollständige Frontier-Modell.
V4 Flash
284 Milliarden Parameter insgesamt, 13 Milliarden aktive Parameter pro Token, 64 Experten mit Top-8-Auswahl. Dieselbe Architektur, komprimiert.
Was identisch ist
Vokabular, Tokenizer, Chat-Vorlage, Thinking-Modi, Kontextlänge (1M), Lizenz MIT, Installationsskripte für llama.cpp / vLLM.
Was sich wirklich ändert
Gesamte VRAM-Kapazität, Durchsatz in Tokens/s, Ergebnisse bei Benchmarks für extrem anspruchsvolles Schlussfolgern (AIME, GPQA Max). Bei alltäglichen Aufgaben ist der Unterschied geringer als erwartet.
i
Die schnelle Faustregel
Flash ≈ 6× weniger Gesamtparameter, 4× weniger aktive Parameter, verliert jedoch nur 5 bis 12 Punkte bei öffentlichen Benchmarktests (je nach Kategorie). Für die meisten lokalen Anwendungen ist Flash der Standardauswahl – Pro ist ein besonderer Fall eines Clusters.

#1. Die VRAM-Schwellen, je nach Version

Das Kit Lokale KI

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Dieses Kriterium entscheidet über fast alles. Hier sind die gemessenen Schwellenwerte für den gesamten VRAM-Bedarf, einschließlich des geladenen Modells und des KV-Caches für 32k Tokens (nicht 1M):

#DeepSeek V4 Pro 1.6T

Q8_0
≈ 1 800 GB. Cluster 8× H200 141GB erforderlich. Kein lokales Single-Machine-Szenario.
Q5_K_M
≈ 1 230 GB. 3 Mac Studio mit jeweils 512 GB im RPC-Swarm oder 4× H200.
Q4_K_M (empfohlen)
≈ 1.040 GB. 8× A100 80GB in Tensor-Parallelismus oder 2× Mac Studio 512 GB im Network Swarm mit llama.cpp.
IQ3_M
≈ 800 GB. Ein einzelner Mac Studio mit 512 GB + teilweise Auslagerung auf SSD. Sehr langsam (~2–4 Tok/s), verminderte Qualität.
IQ2_XS
≈ 560 GB. Einzelner Mac Studio 512 GB. Hohe Qualitätsverluste — nicht empfohlen.

#DeepSeek V4 Flash 284B

FP16
≈ 570 GB. H100/H200-Cluster oder Mac Studio 512 + NVIDIA-Workstation im Swarm.
Q8_0
≈ 305 GB. Mac Studio M3 Ultra mit 512 GB allein oder 4× RTX 6000 Ada mit 48 GB.
Q5_K_M
≈ 210 GB. Mac Studio Ultra 256 GB (an der Grenze) oder 3× RTX 4090 24 GB + Offload
Q4_K_M (empfohlen)
≈ 170 GB. Ein einzelner Mac Studio M2 Ultra mit 192 GB, 2× A6000 mit je 48 GB oder 4× RTX 4090 mit je 24 GB.
IQ3_M
≈ 130 GB. 2× RTX 4090 24GB + Auslagerung in den RAM, oder Mac Studio mit 128 GB.
→
Die praktische Schwelle: 192 GB gemeinsamer Speicher (Unified Memory) oder ~96 GB VRAM
Ab einem Mac Studio mit 192 GB oder einer Konfiguration mit 2–4 professionellen GPUs und insgesamt etwa 96–192 GB läuft Flash Q4 problemlos. An diesem Punkt sollten Sie Pro nicht mehr anstreben — sofern Sie keinen dedizierten Cluster mieten, werden Sie Pro auf einem einzelnen Rechner nicht zum Laufen bringen.

#2. Tatsächliche GPU-Kosten pro Version

Die Zahlen unten sind Hardware-Kaufbudgets, ohne Stromkosten, basierend auf den Preisen vom Mai 2026.

#Um V4 Pro (Q4 ~1 040 GB) zu betreiben

Cluster 8× H200 141GB
≈ 280.000 € für Hardware und Server, ≈ 320.000 € inklusive Installation. Ein „sauberes“ vLLM-Setup mit nativem FP8.
Cluster mit 8× gebrauchten A100 80GB
≈ 90.000 € für die Hardware, mit Gehäuse ≈ 110.000 €. Tensor-Parallelismus mit 640 GB VRAM. Erschwinglicher, aber langsamer.
Swarm 2× Mac Studio M3 Ultra 512 GB
≈ 28.000 € zu den Preisen vom Mai 2026 (der M3 Ultra wird nicht mehr neu verkauft; M5 Ultra mit 512 GB Ende Oktober 2026 angekündigt). Die günstigste lokale Lösung für Pro Q4. Bescheidener, aber tatsächlich erreichbarer Durchsatz (5–8 tok/s), mit llama.cpp RPC über 10 GbE.
Miete einer vergleichbaren Cloud-Konfiguration
≈ 60 €/h bei Lambda/Crusoe für 8× H200. Wird gegenüber dem Kauf nach insgesamt mehr als etwa 5.500 Stunden wirtschaftlich.

#Um V4 Flash (Q4 ~170 GB) zu betreiben

Mac Studio M2 Ultra 192 GB
≈ 4 200 € reconditioniert (kein neuer Verkauf mehr). Kurzeste Solo-Route.
Mac Studio M3 Ultra 256 GB
Wird von Apple nicht mehr neu verkauft (durch den M5 Ultra ersetzt, der mit 256 GB erhältlich ist); gebraucht suchen, Preise variieren. Mehr Spielraum für lange Kontexte und den Thinking-Modus Max.
4× RTX 4090 24GB Workstation
Gebrauchte GPUs (RTX 4090, Preis variabel) + ca. 4.500 € (Gehäuse/Netzteil/CPU). Rein CUDA-basiert, vLLM möglich.
2× RTX 6000 Ada 48GB
Preis prüfen (professionelle Grafikkarte, deren Preis nicht verfolgt wird). Aufgeräumtere Lösung als 4× 4090, weniger laut.
Miete einer vergleichbaren Cloud-Konfiguration
≈ 4 €/h bei Hyperstack/Lambda für 4× A100 80GB. Ab etwa 1.600 kumulierten Betriebsstunden gegenüber einem Mac Studio rentabel.
!
Das Verhältnis von Kosten zu Qualität spricht sehr deutlich für Flash
Ein Mac Studio der Spitzenklasse (Speicherkonfiguration prüfen, die verfügbaren Speicherstufen haben sich bei Apple geändert) führt Flash Q4 mit etwa 12 Tokens pro Sekunde aus. Für Pro Q4 bei demselben Durchsatz ist ein H200-Cluster für 320.000 € erforderlich. Bei einem vernünftigen Budget für den lokalen Betrieb (<30.000 €) ist Flash mathematisch die einzige tragfähige Wahl.

#3. Latenz und Durchsatz im Vergleich

Hier sind die gemessenen Werte bei deaktiviertem Thinking-Modus, einem Kontext von 8k Tokens, einem Prompt von 500 Tokens und einer Generierung von 1.000 Tokens. Die Messwerte stammen aus dem DeepSeek-Paper und Community-Benchmarks vom Mai 2026.

#V4 Pro Q4_K_M

Cluster 8× H200 (vLLM FP8)
TTFT ~0,8s · Durchsatz 38 Tok/s · 1000 Tokens in ~27s
Cluster mit 8× A100 80GB (vLLM Q4)
TTFT ~1,4s · Durchsatz 22 Tok/s · 1000 Tokens in ~47s.
Swarm 2× Mac Studio M3 Ultra 512 (llama.cpp RPC)
TTFT ~6 s · Durchsatz 6 tok/s · 1000 Tokens in ~3 Min. Der durch RPC über das Netzwerk verursachte Geschwindigkeitsverlust dominiert.

#V4 Flash Q4_K_M

Mac Studio M3 Ultra 256 GB (MLX)
TTFT ~0,4s · Durchsatz 28 Tok/s · 1000 Tokens in ~36s. Der ideale Punkt für Einzelnutzung.
Mac Studio M2 Ultra 192 GB (llama.cpp)
TTFT ~0,6s · Durchsatz 14 Tok/s · 1000 Tokens in ~72s.
4× RTX 4090 24GB (vLLM)
TTFT ~0,3 s · Durchsatz 52 tok/s · 1000 Tokens in ~19 s. Lokal am schnellsten.
2× A6000 48GB (vLLM)
TTFT ~0,4s · Durchsatz 38 Tok/s · 1000 Tokens in ~26s.
i
Der Modus 'thinking' verändert alles
Die oben genannten Zahlen gelten bei deaktiviertem Thinking. Im Modus High kommen vor der Antwort 5 bis 20 Sekunden Denkzeit hinzu. Im Modus Max müssen Sie mit 3 bis 30 Minuten rechnen – dieser Modus lässt den Durchsatz einbrechen. Wenn Sie Pro und Flash im Modus Max vergleichen, wird der Unterschied bei der Wartezeit enorm (Pro Max auf einem Cluster bleibt unter 5 Minuten, Flash Max auf einem Mac benötigt oft mehr als 20 Minuten).

#4. Entscheidungsbaum basierend auf Ihrem Hardware-Setup

Fünf Fragen, ein Urteil. Lesen Sie von oben nach unten und hören Sie bei der ersten Antwort auf.

  1. 01
    GPU-Budget > 200.000 € und Bedarf an kompromissloser Frontier-KI?
    → DeepSeek V4 Pro Q4 auf einem Cluster mit 8× H200 oder 8× A100. Sie sind eine Bank, ein Labor oder eine souveräne Verwaltung. Dies ist das einzige Szenario, in dem Pro sinnvoll ist.
  2. 02
    Sie besitzen oder planen 2× Mac Studio M3 Ultra 512 GB (preis variabel, zu überprüfen) und akzeptieren 5–8 Tok/s?
    → V4 Pro Q4 über llama.cpp RPC ist möglich. Nutzen Sie das ausschließlich für nächtliche Batchverarbeitung, niemals für interaktive Nutzung. Andernfalls gehen Sie zum nächsten Schritt.
  3. 03
    Besitzen Sie einen Mac Studio Ultra der Spitzenklasse (heute mit anderen Speicherausstattungen; Preise sind zu prüfen)?
    → V4 Flash Q4 mit MLX oder llama.cpp. 12–28 Tok/s je nach Generation. Die beste Erfahrung für Einzelnutzer im Jahr 2026.
  4. 04
    Besitzen Sie 2 bis 4 NVIDIA-GPUs mit insgesamt >80 GB VRAM?
    → V4 Flash Q4 mit vLLM (vorzuziehen) oder llama.cpp. Höherer Durchsatz als beim Mac Studio, aber mehr Lärm, höherer Stromverbrauch und größerer Platzbedarf.
  5. 05
    Haben Sie weniger als 80 GB VRAM (eine einzelne RTX 4090 usw.)?
    → Weder Pro noch Flash in Q4. Schauen Sie sich die geplanten Flash→32B-Destillationen an oder greifen Sie bis dahin auf DeepSeek V3.5 32B / Qwen3.6 35B-A3B zurück.
→
Das entscheidende Kriterium: interaktiv oder im Batch-Modus
Wenn Sie in Echtzeit chatten möchten, achten Sie auf den Durchsatz in tok/s. Wenn Sie nachts eine PDF-Datei mit 800 Seiten analysieren möchten, achten Sie auf die Qualität im Max-Modus. Flash im interaktiven Betrieb > Pro im nächtlichen Batchbetrieb > Pro im interaktiven Betrieb (außer wenn das Budget für einen Cluster reicht).

#5. Für welchen Einsatzzweck welches der beiden Modelle wählen

Öffentliche Benchmark-Daten sagen nicht alles. Hier ist die ehrliche Bewertung nach Nutzungskategorie.

Allgemeiner Chat-Assistent, Übersetzung, Zusammenfassung
Flash reicht völlig aus. Der Unterschied zu Pro beträgt dabei 2–4 Punkte und ist in der Praxis nicht wahrnehmbar. Geben Sie dem Durchsatz Vorrang.
Code (Generierung, Refactoring, Debugging)
Flash im High-Modus liegt sehr nahe an Pro Non. Bei komplexem Debugging behält Pro Max den Vorteil — allerdings mit einer Wartezeit von 10 Minuten pro Antwort.
Mathematik, Beweis, AIME/GPQA
Pro Max liegt je nach Schwierigkeit 8 bis 15 Punkte vor Flash Max. Das ist der Anwendungsfall, in dem sich der Einsatz von Pro wirklich rechtfertigt.
Analyse von langen Dokumenten (>200k Tokens)
Technischer Gleichstand (beide unterstützen 1 Million Tokens). Der Unterschied wird hauptsächlich durch die CSA-Attention bestimmt, die bei beiden identisch ist. Nach dem verfügbaren VRAM für den KV-Cache auswählen.
Agenten mit Tool-Aufruf
Flash reicht aus. Tool Calling wird durch das Chat-Template und das Instruct-Fine-Tuning gesteuert, nicht durch die Modellgröße.
Lokales Fine-Tuning (LoRA)
Flash ist auf 2× H100 möglich. Pro ist für lokale LoRA-Trainings außer Reichweite – ein Trainingscluster ist erforderlich.
!
Die Falle „Ich will das beste Modell“
Viele möchten Pro „grundsätzlich“ und bedauern danach, nachdem sie 320.000 € für die Erstellung von E-Mails verbrannt haben. Wenn Ihre Anfragen im Modus Nein liegen, zahlen Sie für 99 % ungenutzte Kapazität. Starten Sie mit Flash, messen Sie die Fälle, in denen Flash Max wirklich fehlschlägt, und betrachten Sie Pro nur dann, wenn diese Liste den Kostenunterschied rechtfertigt.

#Tipps und Stolperfallen

Quantisierung des KV-Caches
Bei beiden Modellen – cache-type-k q8_0 --cache-type-v q8_0 (llama.cpp) oder --kv-cache-dtype fp8 (vLLM) – wird die KV-Speicherung durch 2 geteilt, wobei die Qualitätsverluste praktisch null sind. Erforderlich ab einem Kontext von 64k.
Flash Attention erforderlich
Aktivieren Sie -fa (llama.cpp) oder --enable-flash-attn (vLLM). Andernfalls sinkt der Durchsatz um 30 % und der Speicherbedarf steigt bei Kontextlängen über 32k Tokens drastisch an.
Thinking-Modus als Standard
Lassen Sie bei beiden Modellen den Max-Modus niemals standardmäßig aktiviert – ein Agent in einer Endlosschleife kann stundenlang nachdenken. Explizit über /think oder /think_max umschalten.
Multi-GPU mit Pro: Pipeline-Parallelisierung vermeiden
Auf einem H200-Cluster: Tensorparallelismus über 8 GPUs. Pipelineparallelismus verursacht zusätzliche Latenz zwischen den Schichten, die bei einem MoE-Modell mit 1,6T dominiert. vLLM übernimmt das automatisch mit --tensor-parallel-size 8.
Mac-Studio-Swarm: mindestens 10 GbE
RPC in llama.cpp überträgt viele Zwischentensoren. Bei 1 GbE fällt der Durchsatz von Pro unter 1 Tok/s. Planen Sie einen 10-GbE-Switch und SFP+-Kabel ein.
Exakt identische Chat-Vorlagen
Pro und Flash verwenden dasselbe Format. Ein Skript, das für die eine Variante funktioniert, funktioniert auch für die andere – nützlich für A/B-Tests, ohne Ihren Anwendungscode neu schreiben zu müssen.

#Weiterführende Informationen

Wenn Sie sich für eine Version entschieden haben, finden Sie hier die Anleitungen zur Umsetzung:

DeepSeek V4 Pro 1.6T: Architektur, Installation, Benchmarks
Die Cluster-Installationsanleitung für diejenigen, die sich für Pro entschieden haben.
DeepSeek V4 Flash 284B: Das erste Frontier-Modell, das auf dem Mac Studio läuft
Schritt-für-Schritt-Installation auf dem Mac Studio Ultra und detaillierte Benchmarks.
Welches LLM auf dem Mac Studio (M2/M3/M4 Ultra, 64–512 GB)?
Um die Mac-Studio-Konfiguration auf Ihr Budget abzustimmen.
Multi-GPU-Setup mit llama.cpp
Die Referenz für die lokale Einrichtung von 2 bis 4 NVIDIA-GPUs ohne Einbußen bei den Tokens pro Sekunde.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.