NVIDIA DGX Spark: Preis, Spezifikationen und Urteil für lokale KI (2026)
Die kompakte KI-Station von NVIDIA mit 128 GB gemeinsamem Speicher. Wir schauen uns an, worauf es beim Betrieb von LLMs ankommt lokal : Speicher, Bandbreite, Geschwindigkeit, Preis – und für wen sich der Kauf lohnt und für wen nicht.
Aktualisiert am 05.10.2026
Wo kaufen
Die über den Button angebotene Konfiguration entspricht der beim Kauf angebotenen. Halten Sie bei Mini-PCs Speicher für das System frei und prüfen Sie die Inferenz-Engine; macOS/MLX und CUDA sind nicht austauschbar.
Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass dies für Sie zusätzliche Kosten verursacht. Dies beeinflusst diese Empfehlungen (die unabhängig erstellt wurden) nicht. Als Amazon-Partner erzielt QuelLLM Einnahmen aus qualifizierten Käufen.
Technische Daten
- Speicher128 GB vereinheitlichter Speicher (LPDDR5x)
- Bandbreite273 GB/s
- Berechnung≈ 1 PFLOP FP4 — Blackwell-GPU + Grace-CPU mit 20 Arm-Kernen
- Verbrauch140 W
- Richtpreis≈ 6 100 € bei Materiel.net (DGX Spark PNY für 6 099,95 € am 28.09.2026, Lieferzeit von mehr als 15 Tagen; die MSI EdgeXpert mit demselben GB10-Chip und 128 GB kostet 6 599,95 € und ist innerhalb von 7 Tagen lieferbar)
- Größtes ModellNVIDIA positioniert das Gerät seit dem Softwareupdate zur CES 2026 für „bis zu 200B“; in der Praxis laufen ~70B in Q4 komfortabel, begrenzt durch die Bandbreite (273 GB/s). Zwei miteinander verbundene Einheiten betreiben ein Qwen 3.5-122B mit ~40 t/s
Für wen?
Vorteile und Grenzen
✓ Stärken
- 128 GB kohärenter Unified Memory
- Vollständiger CUDA-Stack, lokal
- Kompaktes Format, 140 W
- Ideal für on-premise / air-gapped / Compliance
- Software-Update CES 2026: bis zu +2,5× bei der Inferenz (TensorRT-LLM, spekulative Decodierung)
- Erweiterbar: 2 miteinander verbundene Einheiten = ein 122B-Modell mit ~40 t/s
✗ Einschränkungen
- Bandbreite 273 GB/s mittelmäßig (ein Mac Studio erreicht etwa 2×)
- Hoher Preis gemessen an der reinen Leistung
- Der Vorrat ist oft sehr begrenzt
- Außerhalb des CUDA-/On-Premises-Ökosystems schwer zu empfehlen
Auswahl und Grenzen — Überblick vom 12. September 2026
Das richtige Kriterium: Ihr Modell und Ihre Umgebung
DGX Spark bietet 128 GB vereinheitlichten Speicher in einer NVIDIA-Umgebung. Eine angegebene Modellkapazität garantiert weder das gewünschte Kontextfenster noch einen interaktiven Durchsatz. Prüfen Sie die Quantisierung, die Runtime, die Anzahl der Benutzer und ob sich die Messung auf eine oder zwei Einheiten bezieht.
Quellen: Herstellerdatenblatt von NVIDIA et externe Messungen und Rohdaten zu einem Paar DGX Spark. In dieser Übersicht werden keine eigenen DGX-Spark-Benchmarks beansprucht; Ergebnisse eines Gerätepaars nicht auf ein einzelnes Gerät übertragen.
Zurück zur Hardwareauswahl · Eine erste lokale KI installieren · Unser Protokoll auf einer anderen Maschine prüfen
Dense oder MoE: Was auf dem DGX Spark schnell läuft und was sich quält
Der Speicherbandbreite (273 GB/s) ist der echte Engpass der Maschine. Jeder erzeugte Token erfordert bei einem Modell dense liest sämtliche Gewichte erneut; ein MoE (Mixture of Experts) liest nur seine aktiven Experten. Auf dem DGX Spark ist der Unterschied beeindruckend:
| Modell | Architektur | Gemessene Geschwindigkeit |
|---|---|---|
| gpt-oss-120B (MXFP4/FP8) | MoE — ~5 Milliarden aktive Parameter pro Token | ≈ 40–58 Tok/s je nach Engine (llama.cpp, SGLang) |
| Qwen3-Coder 30B-A3B | MoE — 3B aktive Parameter pro Token | Sehr flüssig, ideal fürs lokale Programmieren |
| Llama 3.1 70B (FP8) | Dense | ≈ 2,7 tok/s (Messung LMSYS) — unangenehm im Alltag |
Praktisches Fazit: Bevorzugen Sie auf diesem Rechner MoE-Modelle — hier kommen die 128 GB voll zur Geltung. Unser DGX-Spark-Leitfaden für lokale KI erläutert die Einstellungen, und der Katalog filtert die Modelle nach VRAM.
Im Vergleich zu Alternativen mit 128 GB
Drei Desktop-Systeme bieten heute in ihrem vereinheitlichten Speicher Platz für ein sehr großes Modell:
| Rechner | Speicher | Bandbreite | Richtpreis | Ökosystem |
|---|---|---|---|---|
| NVIDIA DGX Spark | 128 GB | 273 GB/s | ≈ 6 100 – 6 600 € (Materiel.net, 28.09.2026) | vollständige CUDA-Unterstützung |
| Mini-PC Ryzen AI Max+ 395 | bis zu 128 GB | 256 GB/s | ≈ 1.900–3.900 € je nach Konfiguration | ROCm / Vulkan |
| Mac Studio M5 Max | 36-128 GB | 460–614 GB/s | ab 2.999 € (36 GB) | MLX / Metal |
Bei gleichem Budget bringt der Strix Halo die gleichen MoE zu 2 bis 4 Mal geringerem Preis; der Mac weist deutlich höhere Bandbreitenleistung auf. Der DGX Spark behält seinen einzigartigen Vorteil: die vollständige CUDA-Stack bei nur 140 W. Detaillierte Vergleichsdaten: Strix Halo vs. DGX Spark.
DGX Spark in Unternehmen: Gesamtkosten, Rentabilitätsgrenze und Cluster mit zwei Einheiten
Inhalt aus dem Leitfaden „DGX und Spark: Kostenanalyse für IT-Leiter“ (am 08.09.2026 in diese Übersicht integriert). Der offizielle Preis stieg am 27. Februar 2026 von 3.999 $ auf 4.699 $ (+17,5 %), wobei NVIDIA auf Lieferengpässe bei LPDDR5X verwies; in Frankreich liegt der bei Drittanbietern beobachtete Preis weiterhin deutlich darüber (siehe den Preisabschnitt oben).
- Rentabilitätsschwelle : Sobald die Rechnung für Cloud-Inferenz regelmäßig ~300 bis 500 € pro Monat übersteigt, wird der Kauf über einen Zeitraum von 12 bis 18 Monaten wirtschaftlich sinnvoll – noch bevor die Datensouveränität berücksichtigt wird (DSGVO-relevante, medizinische oder juristische Daten, die das Gebäude niemals verlassen). Es handelt sich um eine einmalige CAPEX-Investition, die über 3–4 Jahre abgeschrieben wird, gegenüber einer fortlaufenden Cloud-Rechnung.
- Was 128 GB tatsächlich ermöglichen : Ein 70B-Modell in Q4_K_M belegt ≈ 40 GB, ein stark quantisiertes 120B-Modell ≈ 70–80 GB; es bleibt Spielraum für den Kontext und den KV-Cache, während eine 24-GB-Karte bei etwa 32B an ihre Grenze stößt.
- Softwarebedingter Leistungsgewinn zur CES 2026 : bis zu ×2,5 auf demselben Rechner durch TensorRT-LLM und spekulative Decodierung – der größte Gewinn bei vorhersehbaren Ausgaben (Code, JSON, strukturierter Text), ein geringerer bei kreativem Text.
- Zwei verbundene Einheiten (ConnectX): insgesamt 256 GB, Qwen 3.5-122B mit ~40 Tokens/s; Budget ≈ 9.400 $ netto. Die Kopplung verdoppelt den Speicher zugänglich, nicht unbedingt den Durchsatz eines Modells, das bereits auf eine einzige Maschine passte.
- Kriterium für die Auswahl : CUDA + Clustering → DGX Spark; enges Budget → Mini-PC Ryzen AI Max+ 395 (128 GB, ROCm-Ökosystem weniger reif); Bandbreite und Vielseitigkeit → Mac Studio (> 800 GB/s, MLX/Metal).
Für ein Unternehmen, das die Integration lieber delegiert, als eine solche Maschine selbst zusammenzubauen, bietet IAPRO ein schlüsselfertiges Hardware- und KI-Paket für kleine und mittlere Unternehmen : Auswahl des Servers, Bereitstellung der Modelle und Schulung der Teams.
Fazit
Häufige Fragen
Kann der NVIDIA DGX Spark ein 70B-LLM lokal ausführen?
NVIDIA positioniert das Gerät seit dem Software-Update zur CES 2026 für Modelle mit „bis zu 200B“; in der Praxis lassen sich etwa 70B in Q4 komfortabel betreiben, wobei die Bandbreite (273 GB/s) begrenzt. Zwei miteinander verbundene Einheiten betreiben ein Qwen 3.5-122B mit etwa 40 Tokens/s.
Wie viel kostet der NVIDIA DGX Spark?
Mit ≈ 6 100 € bei Materiel.net rechnen (DGX Spark PNY für 6 099,95 € am 28.09.2026, Lieferzeit von mehr als 15 Tagen; die MSI EdgeXpert mit demselben GB10-Chip und 128 GB kostet 6 599,95 € und ist innerhalb von 7 Tagen lieferbar) (offiziell 4 699 $ (am 27. Februar 2026 von 3 999 $ angehoben)). Die Preise ändern sich schnell – prüfen Sie den aktuellen Preis über die Kauflinks.
Für wen ist der NVIDIA DGX Spark geeignet?
Entwickler, die fest im CUDA-Ökosystem verankert sind, lokales Fine-Tuning und On-Premise- oder Air-Gapped-Umgebungen.
Wo kann man den DGX Spark in Frankreich kaufen?
Materiel.net führt das Produkt: Der DGX Spark PNY kostete dort am 28.09.2026 6.099,95 €, mit einer Lieferzeit von mehr als 15 Tagen. Anderswo ist er vor allem über Drittanbieter erhältlich, zu höheren und schwankenden Preisen. Eine ernstzunehmende Alternative sind die GB10-Rechner der Partner (Asus Ascent GX10, Dell, HP, Lenovo…), mit demselben Chip und demselben Speicher, oft besser verfügbar – die vollständige Liste finden Sie in unserem DGX-Spark-Guide.
DGX Spark oder RTX 5090 für die lokale KI?
Zwei Philosophien: Die RTX 5090 bietet 32 GB GDDR7 mit ~1,8 TB/s — jedes Modell, das in 32 GB passt, wird dort viel schneller laufen. Der DGX Spark bietet 4× die Kapazität (128 GB), aber mit 273 GB/s: Er beherbergt Modelle, die die 5090 nicht laden kann, und bedient sie langsamer. Wenn Ihre Zielmodelle weniger als 32 GB groß sind, wählen Sie die GPU; siehe GPU für die lokale KI auswählen.
Soll man auf die PCs „RTX Spark“ warten statt einen DGX Spark zu kaufen?
Die RTX-Spark-Geräte (vom GB10 abgeleiteter Chip, bis zu 128 GB vereinheitlichter Speicher) sind bei Asus, Dell, HP, Lenovo, MSI und Microsoft für Herbst 2026 bestätigt – acht Geräte wurden angekündigt, darunter auch Notebooks. Mit Stand vom 31. August 2026 wurden jedoch noch keine Preise veröffentlicht, und Vorbestellungen sind noch nicht möglich. Wenn Sie sofort eine Lösung mit CUDA benötigen, bleibt der DGX Spark die einzige lieferbare Option; andernfalls wird das Warten bis zum Herbst die Auswahl deutlich erweitern.