Mittelstufe 14 Min.DeepSeek

DeepSeek V4 Flash 284B : der 1. frontier, der auf Mac läuft Studio

DeepSeek V4 Flash 284B erschien am 24. April 2026 gleichzeitig mit V4 Pro. Es ist die „effiziente“ Variante: insgesamt 284 Milliarden Parameter in einer MoE-Architektur (13 Milliarden aktive Parameter pro Token), MIT-Lizenz, ein Kontext von 1 Million Tokens, dieselbe CSA+HCA-Architektur und dieselben 3 Thinking-Modi wie beim Pro-Modell. Vor allem ist es das erste Modell der Frontier-Klasse, das auf eine einzige Workstation passt: 170 GB in Q4 – ein Mac Studio M3 Ultra mit 256 GB reicht aus. Dieser Leitfaden erklärt, wie Sie es installieren und was es leistet.

Von Mohamed Meguedmi·Aktualisierung 2026-08-11·Unter Windows, macOS und Linux getestet

#DeepSeek V4 Flash kurz erklärt

Erscheinungsdatum
24. April 2026, gleichzeitig mit V4 Pro. Verfügbar auf HuggingFace: deepseek-ai/DeepSeek-V4-Flash.
Architektur
MoE mit insgesamt 284 Milliarden Parametern, davon 13 Milliarden pro Token aktiv. 128 Experten pro Schicht, Top-8-Routing. Base- und Instruct-Varianten verfügbar.
Vom Pro übernommene Innovationen
CSA+HCA-Attention, mHC, Muon-Optimierer, gemischtes FP4+FP8-Training.
Kontext
1.000.000 native Tokens (wie bei Pro).
Denkmodi
3 Stufen: Non / High / Max – per Prompt umschaltbar.
Lizenz
MIT, dieselbe Lizenz wie beim Pro. Keine Einschränkungen der kommerziellen Nutzung und keine geografischen Einschränkungen.

#1. Warum das ein besonderes Ereignis ist

Vor dem 24. April 2026 bedeutete ein lokal ausgeführtes Frontier-Modell entweder einen GPU-Cluster für mehr als 80.000 € oder Abstriche bei der Qualität mit einem 70B-Modell. DeepSeek V4 Flash ändert das: 170 GB in Q4 passen auf Konfigurationen aus gebrauchter Hardware für 4.000 bis 8.000 €.

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen
Mac Studio M3 Ultra 256 GB
Bis September 2026 für 7.299 € im Katalog, inzwischen gebraucht erhältlich (bei Apple durch den M5 Ultra mit 256 GB ersetzt). 170 GB für das Modell + 30 GB für den Kontext = passt mit reichlich Spielraum in den Speicher. ~10–12 Tokens/s in Q4.
2× RTX 5090 32 GB (64 GB VRAM)
≈ 11.400 €. Unzureichend – es fehlen ~110 GB. Mit CPU-Offload möglich, aber langsam (3–5 Tokens/s).
4× RTX A6000 48 GB (192 GB VRAM)
~12.000 € gebraucht. Das Modell passt mit ausreichend Spielraum in den Speicher, ~18–25 Tokens/s.
Workstation 2× Mac Studio Max 64 GB
Im Einzelbetrieb nicht ausreichend. Mit llama.cpp RPC swarm und 4× Mac Studio: möglich, ~5 tok/s.
→
Die eigentliche Besonderheit: Mac Studio Ultra
Der M3 Ultra mit 256 GB (bis September 2026 für 7.299 € im Katalog, inzwischen gebraucht erhältlich) führt DeepSeek V4 Flash Q4 im Chatmodus mit ~10 Tok/s aus. Kein anderer Computer für den persönlichen Gebrauch weltweit kann zu diesem Preis ein Frontier-Modell ausführen. Möglich macht das Apple Silicon (vereinheitlichter Speicher + Bandbreite von 800 GB/s).

#2. Architektur (effiziente Variante von V4)

V4 Flash ist eine proportional verkleinerte Version von V4 Pro: etwa ein 5,7-tel der Experten und ein 3,8-tel der aktiven Parameter, aber dieselbe Grundstruktur CSA+HCA + Muon + FP4/FP8. Diese Einheitlichkeit ermöglicht es V4 Flash, die Qualität von Pro zu deutlich geringeren Kosten zu übernehmen.

Experten pro Schicht
128 (im Vergleich zu 256 für Pro). Top-8-Routing ist identisch.
Aktive Parameter
13B (gegenüber 49B bei Pro). Bei gleicher Gesamtzahl an Parametern ist die Inferenzgeschwindigkeit etwa 3,8-mal so hoch.
Schichten
61 (Pro: 76). Moderate Reduktion, um die Tiefe des Denkens zu erhalten.
Attention-Heads
Identisch mit Pro (CSA+HCA identisch konfiguriert). Keine Einsparungen bei der Attention, um die Qualität bei langen Kontexten zu erhalten.
Vorabtraining
Ziel: „efficient reasoning“; 18T Tokens (gegenüber 32T bei Pro), mit einem für Mathematik und Code optimierten Datenmix.

#3. Hardware je nach Quantisierung

Gesamter VRAM-Bedarf (Modell + KV-Cache für 32k Tokens)
QuantizationModell-VRAM+ KV 32kEmpfohlene Konfigurationen
FP16 (Referenz)568 GB~620 GBDC: 4× H200 141GB. Lokal nicht praktikabel.
Q8_0305 GB~340 GBMac Studio M3 Ultra 512 GB oder 8× RTX 4090 24 GB.
Q5_K_M205 GB~235 GBMac Studio Ultra mit 256 GB (knapp ausreichend), 4× RTX A6000 mit je 48 GB bieten ausreichend Spielraum.
Q4_K_M170 GB~200 GBMac Studio Ultra 256 GB, 4× RTX 4090 24GB, 2× RTX 6000 Ada 48GB.
IQ3_M (komprimiert)130 GB~160 GBMac Studio M2 Ultra 192 GB, 4× RTX 4090 (leichter Offload).
IQ2_XS (extrem)85 GB~115 GBRTX 5090 + 64 GB DDR5 Offload oder 2× RTX 4090
i
Sweet spot 2026
Der Mac Studio M3 Ultra mit 256 GB bietet bei Q4_K_M das beste Verhältnis zwischen Preis, Qualität und Geschwindigkeit für eine anspruchsvolle private Nutzung. Bis September 2026 kostete er neu 7.300 € (inzwischen gebraucht erhältlich, oder ein M5 Ultra mit 256 GB als Neugerät), ~10 Tokens/s, nahezu FP16-Qualität (Q4 verliert bei dieser Modellgröße <2 % in Benchmarks). Ein vergleichbarer PC kostet mehr als 12.000 €.

#4. Mac Studio Ultra 256/512 GB einrichten

Vollständige Installation auf dem Mac Studio M3 Ultra
# 1. Relever la mémoire GPU allouable
sudo sysctl iogpu.wired_limit_mb=240640    # 256 Go : 235 Go GPU
# Ou pour Mac Studio 512 Go :
# sudo sysctl iogpu.wired_limit_mb=491520

# Persistant
echo "iogpu.wired_limit_mb=240640" | sudo tee -a /etc/sysctl.conf

# 2. llama.cpp avec Metal + Flash Attention
git clone https://github.com/ggerganov/llama.cpp && cd llama.cpp
make GGML_METAL=1 LLAMA_METAL_EMBED_LIBRARY=1

# 3. Téléchargement Q4_K_M (~170 Go split en chunks)
huggingface-cli download deepseek-ai/DeepSeek-V4-Flash-GGUF \
  --include "*Q4_K_M*.gguf" \
  --local-dir ./models

# 4. Lancement avec optimisations max
./build/bin/llama-server \
  -m ./models/DeepSeek-V4-Flash-Q4_K_M-00001-of-00004.gguf \
  -ngl 99 -fa \
  -ctk q8_0 -ctv q8_0 \
  -c 65536 \
  --host 0.0.0.0 --port 8080
→
Nach dem Start
Der Server stellt unter http://localhost:8080 eine OpenAI-kompatible API bereit. Verbinden Sie Open WebUI, Continue.dev, Aider und Raycast AI damit – alle werden mit Ihrem lokalen Frontier-Modell funktionieren.

#5. Setup mehrerer NVIDIA-GPUs

#Option A — vLLM 4× RTX A6000 (48 GB × 4 = 192 GB)

vLLM tensor-parallel
pip install vllm>=0.7

vllm serve deepseek-ai/DeepSeek-V4-Flash \
  --tensor-parallel-size 4 \
  --quantization fp8 \
  --max-model-len 1000000 \
  --enable-prefix-caching \
  --port 8000

#Option B — llama.cpp mit teilweisem Offload

2× RTX 5090 + CPU-Offload
./build/bin/llama-server \
  -m ./models/DeepSeek-V4-Flash-Q4_K_M-00001-of-00004.gguf \
  -ngl 50 \
  --tensor-split 0.5,0.5 \
  -ctk q8_0 -ctv q8_0 \
  -c 32768
!
Offload = langsam
Alles, was nicht in den VRAM passt, wird in den System-RAM ausgelagert (DDR5 mit ~80 GB/s gegenüber HBM3 mit 1 TB/s). Wenn 50 % ausgelagert sind, sinkt die Geschwindigkeit auf 3–5 Tokens pro Sekunde. Für eine interaktive Nutzung sollten Sie anstreben, dass das Modell zu 100 % im VRAM liegt.

#6. Benchmarks und gemessene Tokens/s

Von DeepSeek veröffentlichte Benchmarks (24. April 2026), Werte im High-Modus
BenchmarkV4 FlashV4 ProLlama 4 Scout 109BMistral Large 2
MMLU-Pro79.484.276.875.3
GPQA Diamond70.178.563.259.4
AIME 202576.587.061.352.1
LiveCodeBench v572.679.865.461.8
LongBench v2 (1M)68.972.6——
Gemessene Tokens pro Sekunde (Chat, Kontext 4k, Q4_K_M)
SetupTok/s im Modus NonTok/s im Modus HighTok/s im Modus Max
Mac Studio M3 Ultra 256 GB10-128-105-7
Mac Studio M3 Ultra 512 GB12-1410-127-9
4× RTX A6000 48GB20-2516-2012-15
2× RTX 5090 + 64 GB Offload3-52-41-2

#7. Denkmodi und langer Kontext

V4 Flash übernimmt die drei Thinking-Modi von V4 Pro bei etwas geringerer Qualität, aber deutlich niedrigeren Inferenzkosten. Es ist die richtige Wahl für Agenten, die Schlussfolgerungen ziehen müssen, ohne eine Infrastruktur vollständig für sich zu beanspruchen.

Modus „Non“
Direkte Antwort. Sehr niedrige Latenz (~1 s bis zum Beginn des Streamings). Für dialogorientierte Chats und Übersetzungen.
Modus High
200 bis 2000 Chain-of-Thought-Tokens vor der Antwort. +25 % Qualität bei Mathematik/Code. Latenz von 5 bis 15 Sekunden bis zum ersten Token der endgültigen Antwort.
Max-Modus
Bis zu 16.000 Tokens für das Nachdenken. Latenz bei lokaler Ausführung: 1–5 Minuten. Anspruchsvollen Problemen vorbehalten (mathematische Beweise, komplexes Debugging).
Langer Kontext: 1M
Gleiche Fähigkeiten wie V4 Pro dank HCA – Needle-in-Haystack 1M ~95 % (gegenüber 98 % bei Pro). Hervorragend für RAG auf großen Datenbeständen.

#V4 Flash vs V4 Pro: wählen

Vergleich im Überblick
KriteriumV4 Flash 284BV4 Pro 1.6T
Gesamtparameter284 B1 600 B
Aktive Parameter / Token13 B49 B
VRAM Q4_K_M170 GB960 GB
Minimaler lokaler HardwarebedarfMac Studio Ultra 256 GB (M3 Ultra gebraucht oder M5 Ultra neu)Cluster ~80.000 €
Typische Tokens pro Sekunde im lokalen Betrieb10-250,5-2
MMLU-Pro-Qualität79.484.2
Qualität bei AIME 202576.587.0
Nativer Kontext1 M1 M
Thinking-Modus „max“JaJa (bessere Qualität)
LizenzMITMIT
→
Wann Flash wählen, wann Pro
V4 Flash: 95 % der Fälle — Chat, Code, RAG, Agenten, langer Kontext. Das einzige Frontier-Modell, das auf eine Workstation passt. V4 Pro: reine Forschung (Mathematik, Beweise, AIME auf Wettbewerbsniveau), Workflows, bei denen maximale Qualität wichtiger ist als Latenz und Hardwarekosten.

#Am 31. Juli 2026 offiziell vorgestellt (Build 0731)

DeepSeek hat V4-Flash Ende Juli 2026 mit dem Build „0731“ aus der Preview-Phase herausgeführt: Die API ist in der öffentlichen Beta, und zugleich sinkt der Preis für Ausgabetokens von V4-Pro um 75 % (0,87 $ pro Million Ausgabetokens). Artificial Analysis ordnet die V4-Familie wieder „unter den führenden Open-Weight-Modellen“ ein. An den Modellgewichten ändert sich nichts: insgesamt 284 Milliarden Parameter, davon 13 Milliarden aktiv — weiterhin die einzige V4-Variante, die sich mit aggressiver Quantisierung auf lokalen High-End-Systemen (Mac mit 256 GB, Strix Halo, mehrere GPUs) einigermaßen betreiben lässt.

Seit dem 2. August bietet LM Studio es ebenfalls an: lokal, wenn Ihre Maschine leistungsfähig genug ist, oder über die Bionic-App auf US-amerikanischen Servern mit „Zero Data Retention“ als Standard – ein Kompromiss, den Sie kennen sollten, auch wenn die Philosophie dieser Website weiterhin auf einem zu 100 % lokalen Betrieb beruht.

#FAQ

Läuft DeepSeek V4 Flash wirklich auf einem Mac Studio M3 Ultra mit 256 GB?+
Ja, mit Q4_K_M: 170 GB für das Modell + 30 GB für den 32k-Kontext + 8 GB für das System = ca. 210 GB, also innerhalb der 256 GB. Gemessene Geschwindigkeit: 10–12 Tokens/s im Modus Non, 8–10 im Modus High. Dies ist im April 2026 der einzige Mac, der das auf einer einzelnen Maschine schafft.
Wie viel kostet ein brauchbares Setup, um V4 Flash lokal auszuführen?+
Drei Budgets: (1) Mac Studio Ultra mit 256 GB — ein gebrauchter M3 Ultra (Neupreis bis September 2026: 7 300 €) oder ein neuer M5 Ultra. (2) ca. 12 000 € — 4× gebrauchte RTX A6000 mit je 48 GB + Workstation. (3) ca. 11 400 € — 2× RTX 5090 + 64 GB DDR5 + Offloading, aber langsam (3–5 Tok/s).
Soll man V4 Flash wählen oder auf eine 70B-Distillation warten?+
DeepSeek hat 70B- und 32B-Distillationen innerhalb von 4–6 Wochen angekündigt. Wenn Sie weder einen Mac Studio Ultra noch einen GPU-Cluster besitzen, ist Warten sinnvoll. Wenn Sie eines davon bereits besitzen, gilt: V4 Flash jetzt >> 70B-Distillation in 5 Wochen (höhere Qualität und 1M-Kontext).
Schlägt V4 Flash Llama 4 Maverick / Scout?+
Laut den von DeepSeek veröffentlichten Benchmarks: Ja, bei allen (MMLU-Pro 79,4 vs. 76,8 für Scout, GPQA 70,1 vs. 63,2). Unabhängige Bestätigung wird innerhalb von 2 Wochen über Chatbot Arena erwartet. Klarer Vorteil von V4 Flash: nativer 1M-Kontext, während Llama 4 bei 256k bleibt.
Wie hoch ist der Stromverbrauch eines Mac Studio M3 Ultra bei der Inferenz mit V4 Flash?+
Maximaler Verbrauch ~150 W bei der Generierung, ~30 W im Ruhezustand nach dem Laden. Bei 8 Stunden aktiver Nutzung: ~1,2 kWh = ~0,30 €/Tag (FR 2026). Eine LED-Leuchte verbraucht im Standby mehr.
Lohnt sich der Thinking-Max-Modus bei V4 Flash?+
Auf einem Mac Studio: ja, für schwierige Probleme (Mathematik, Beweise, Debugging), aber rechnen Sie mit 1–5 Minuten pro Antwort. Für die normale Chatnutzung reicht der Modus High mehr als aus (8–10 tok/s, Qualität ~Mistral Large × 2).
Lässt sich V4 Flash lokal per Fine-Tuning anpassen?+
LoRA / QLoRA: ja, auf einem Mac Studio Ultra mit 512 GB über MLX-LM (die Unterstützung muss je nach installierter Version geprüft werden) oder unsloth (NVIDIA, mindestens 4× A6000). Vollständiges Fine-Tuning: lokal nicht praktikabel — geschätzte Trainingskosten in der Cloud: 200.000–400.000 $.
Gibt es mit Stand vom 25. April 2026 eine stabile Q4-quantisierte Version?+
Die offiziellen GGUF-Quantisierungen Q4_K_M und Q5_K_M erscheinen dieses Wochenende (26.–27. April) auf HuggingFace. AWQ-Quantisierungen für vLLM: bereits verfügbar (deepseek-ai/DeepSeek-V4-Flash-AWQ). Folgen Sie @DeepSeek_AI auf X, um Ankündigungen zu erhalten.

Die Preise ändern sich schnell: Unser Tracking erfasst jeden Montag und Donnerstag den niedrigsten Preis für GPUs für lokale KI, einschließlich des Preises pro GB VRAM.

Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.