DeepSeek V4 Flash 284B : der 1. frontier, der auf Mac läuft Studio
DeepSeek V4 Flash 284B erschien am 24. April 2026 gleichzeitig mit V4 Pro. Es ist die „effiziente“ Variante: insgesamt 284 Milliarden Parameter in einer MoE-Architektur (13 Milliarden aktive Parameter pro Token), MIT-Lizenz, ein Kontext von 1 Million Tokens, dieselbe CSA+HCA-Architektur und dieselben 3 Thinking-Modi wie beim Pro-Modell. Vor allem ist es das erste Modell der Frontier-Klasse, das auf eine einzige Workstation passt: 170 GB in Q4 – ein Mac Studio M3 Ultra mit 256 GB reicht aus. Dieser Leitfaden erklärt, wie Sie es installieren und was es leistet.
#DeepSeek V4 Flash kurz erklärt
- Erscheinungsdatum
- 24. April 2026, gleichzeitig mit V4 Pro. Verfügbar auf HuggingFace: deepseek-ai/DeepSeek-V4-Flash.
- Architektur
- MoE mit insgesamt 284 Milliarden Parametern, davon 13 Milliarden pro Token aktiv. 128 Experten pro Schicht, Top-8-Routing. Base- und Instruct-Varianten verfügbar.
- Vom Pro übernommene Innovationen
- CSA+HCA-Attention, mHC, Muon-Optimierer, gemischtes FP4+FP8-Training.
- Kontext
- 1.000.000 native Tokens (wie bei Pro).
- Denkmodi
- 3 Stufen: Non / High / Max – per Prompt umschaltbar.
- Lizenz
- MIT, dieselbe Lizenz wie beim Pro. Keine Einschränkungen der kommerziellen Nutzung und keine geografischen Einschränkungen.
#1. Warum das ein besonderes Ereignis ist
Vor dem 24. April 2026 bedeutete ein lokal ausgeführtes Frontier-Modell entweder einen GPU-Cluster für mehr als 80.000 € oder Abstriche bei der Qualität mit einem 70B-Modell. DeepSeek V4 Flash ändert das: 170 GB in Q4 passen auf Konfigurationen aus gebrauchter Hardware für 4.000 bis 8.000 €.
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
- Mac Studio M3 Ultra 256 GB
- Bis September 2026 für 7.299 € im Katalog, inzwischen gebraucht erhältlich (bei Apple durch den M5 Ultra mit 256 GB ersetzt). 170 GB für das Modell + 30 GB für den Kontext = passt mit reichlich Spielraum in den Speicher. ~10–12 Tokens/s in Q4.
- 2× RTX 5090 32 GB (64 GB VRAM)
- ≈ 11.400 €. Unzureichend – es fehlen ~110 GB. Mit CPU-Offload möglich, aber langsam (3–5 Tokens/s).
- 4× RTX A6000 48 GB (192 GB VRAM)
- ~12.000 € gebraucht. Das Modell passt mit ausreichend Spielraum in den Speicher, ~18–25 Tokens/s.
- Workstation 2× Mac Studio Max 64 GB
- Im Einzelbetrieb nicht ausreichend. Mit llama.cpp RPC swarm und 4× Mac Studio: möglich, ~5 tok/s.
#2. Architektur (effiziente Variante von V4)
V4 Flash ist eine proportional verkleinerte Version von V4 Pro: etwa ein 5,7-tel der Experten und ein 3,8-tel der aktiven Parameter, aber dieselbe Grundstruktur CSA+HCA + Muon + FP4/FP8. Diese Einheitlichkeit ermöglicht es V4 Flash, die Qualität von Pro zu deutlich geringeren Kosten zu übernehmen.
- Experten pro Schicht
- 128 (im Vergleich zu 256 für Pro). Top-8-Routing ist identisch.
- Aktive Parameter
- 13B (gegenüber 49B bei Pro). Bei gleicher Gesamtzahl an Parametern ist die Inferenzgeschwindigkeit etwa 3,8-mal so hoch.
- Schichten
- 61 (Pro: 76). Moderate Reduktion, um die Tiefe des Denkens zu erhalten.
- Attention-Heads
- Identisch mit Pro (CSA+HCA identisch konfiguriert). Keine Einsparungen bei der Attention, um die Qualität bei langen Kontexten zu erhalten.
- Vorabtraining
- Ziel: „efficient reasoning“; 18T Tokens (gegenüber 32T bei Pro), mit einem für Mathematik und Code optimierten Datenmix.
#3. Hardware je nach Quantisierung
| Quantization | Modell-VRAM | + KV 32k | Empfohlene Konfigurationen |
|---|---|---|---|
| FP16 (Referenz) | 568 GB | ~620 GB | DC: 4× H200 141GB. Lokal nicht praktikabel. |
| Q8_0 | 305 GB | ~340 GB | Mac Studio M3 Ultra 512 GB oder 8× RTX 4090 24 GB. |
| Q5_K_M | 205 GB | ~235 GB | Mac Studio Ultra mit 256 GB (knapp ausreichend), 4× RTX A6000 mit je 48 GB bieten ausreichend Spielraum. |
| Q4_K_M | 170 GB | ~200 GB | Mac Studio Ultra 256 GB, 4× RTX 4090 24GB, 2× RTX 6000 Ada 48GB. |
| IQ3_M (komprimiert) | 130 GB | ~160 GB | Mac Studio M2 Ultra 192 GB, 4× RTX 4090 (leichter Offload). |
| IQ2_XS (extrem) | 85 GB | ~115 GB | RTX 5090 + 64 GB DDR5 Offload oder 2× RTX 4090 |
#4. Mac Studio Ultra 256/512 GB einrichten
#5. Setup mehrerer NVIDIA-GPUs
#Option A — vLLM 4× RTX A6000 (48 GB × 4 = 192 GB)
#Option B — llama.cpp mit teilweisem Offload
#6. Benchmarks und gemessene Tokens/s
| Benchmark | V4 Flash | V4 Pro | Llama 4 Scout 109B | Mistral Large 2 |
|---|---|---|---|---|
| MMLU-Pro | 79.4 | 84.2 | 76.8 | 75.3 |
| GPQA Diamond | 70.1 | 78.5 | 63.2 | 59.4 |
| AIME 2025 | 76.5 | 87.0 | 61.3 | 52.1 |
| LiveCodeBench v5 | 72.6 | 79.8 | 65.4 | 61.8 |
| LongBench v2 (1M) | 68.9 | 72.6 | — | — |
| Setup | Tok/s im Modus Non | Tok/s im Modus High | Tok/s im Modus Max |
|---|---|---|---|
| Mac Studio M3 Ultra 256 GB | 10-12 | 8-10 | 5-7 |
| Mac Studio M3 Ultra 512 GB | 12-14 | 10-12 | 7-9 |
| 4× RTX A6000 48GB | 20-25 | 16-20 | 12-15 |
| 2× RTX 5090 + 64 GB Offload | 3-5 | 2-4 | 1-2 |
#7. Denkmodi und langer Kontext
V4 Flash übernimmt die drei Thinking-Modi von V4 Pro bei etwas geringerer Qualität, aber deutlich niedrigeren Inferenzkosten. Es ist die richtige Wahl für Agenten, die Schlussfolgerungen ziehen müssen, ohne eine Infrastruktur vollständig für sich zu beanspruchen.
- Modus „Non“
- Direkte Antwort. Sehr niedrige Latenz (~1 s bis zum Beginn des Streamings). Für dialogorientierte Chats und Übersetzungen.
- Modus High
- 200 bis 2000 Chain-of-Thought-Tokens vor der Antwort. +25 % Qualität bei Mathematik/Code. Latenz von 5 bis 15 Sekunden bis zum ersten Token der endgültigen Antwort.
- Max-Modus
- Bis zu 16.000 Tokens für das Nachdenken. Latenz bei lokaler Ausführung: 1–5 Minuten. Anspruchsvollen Problemen vorbehalten (mathematische Beweise, komplexes Debugging).
- Langer Kontext: 1M
- Gleiche Fähigkeiten wie V4 Pro dank HCA – Needle-in-Haystack 1M ~95 % (gegenüber 98 % bei Pro). Hervorragend für RAG auf großen Datenbeständen.
#V4 Flash vs V4 Pro: wählen
| Kriterium | V4 Flash 284B | V4 Pro 1.6T |
|---|---|---|
| Gesamtparameter | 284 B | 1 600 B |
| Aktive Parameter / Token | 13 B | 49 B |
| VRAM Q4_K_M | 170 GB | 960 GB |
| Minimaler lokaler Hardwarebedarf | Mac Studio Ultra 256 GB (M3 Ultra gebraucht oder M5 Ultra neu) | Cluster ~80.000 € |
| Typische Tokens pro Sekunde im lokalen Betrieb | 10-25 | 0,5-2 |
| MMLU-Pro-Qualität | 79.4 | 84.2 |
| Qualität bei AIME 2025 | 76.5 | 87.0 |
| Nativer Kontext | 1 M | 1 M |
| Thinking-Modus „max“ | Ja | Ja (bessere Qualität) |
| Lizenz | MIT | MIT |
#Am 31. Juli 2026 offiziell vorgestellt (Build 0731)
DeepSeek hat V4-Flash Ende Juli 2026 mit dem Build „0731“ aus der Preview-Phase herausgeführt: Die API ist in der öffentlichen Beta, und zugleich sinkt der Preis für Ausgabetokens von V4-Pro um 75 % (0,87 $ pro Million Ausgabetokens). Artificial Analysis ordnet die V4-Familie wieder „unter den führenden Open-Weight-Modellen“ ein. An den Modellgewichten ändert sich nichts: insgesamt 284 Milliarden Parameter, davon 13 Milliarden aktiv — weiterhin die einzige V4-Variante, die sich mit aggressiver Quantisierung auf lokalen High-End-Systemen (Mac mit 256 GB, Strix Halo, mehrere GPUs) einigermaßen betreiben lässt.
Seit dem 2. August bietet LM Studio es ebenfalls an: lokal, wenn Ihre Maschine leistungsfähig genug ist, oder über die Bionic-App auf US-amerikanischen Servern mit „Zero Data Retention“ als Standard – ein Kompromiss, den Sie kennen sollten, auch wenn die Philosophie dieser Website weiterhin auf einem zu 100 % lokalen Betrieb beruht.
#FAQ
Läuft DeepSeek V4 Flash wirklich auf einem Mac Studio M3 Ultra mit 256 GB?+
Wie viel kostet ein brauchbares Setup, um V4 Flash lokal auszuführen?+
Soll man V4 Flash wählen oder auf eine 70B-Distillation warten?+
Schlägt V4 Flash Llama 4 Maverick / Scout?+
Wie hoch ist der Stromverbrauch eines Mac Studio M3 Ultra bei der Inferenz mit V4 Flash?+
Lohnt sich der Thinking-Max-Modus bei V4 Flash?+
Lässt sich V4 Flash lokal per Fine-Tuning anpassen?+
Gibt es mit Stand vom 25. April 2026 eine stabile Q4-quantisierte Version?+
Die Preise ändern sich schnell: Unser Tracking erfasst jeden Montag und Donnerstag den niedrigsten Preis für GPUs für lokale KI, einschließlich des Preises pro GB VRAM.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.