NVIDIA DGX Spark: der KI-Mini-PC mit 128 GB im Vergleich zu GPU
Mit dem DGX Spark setzt NVIDIA auf lokale KI am Schreibtisch: ein Grace-Blackwell-Chip, 128 GB vereinheitlichter Speicher und ein Format, das auf eine Tischecke passt. Auf dem Papier kann er Modelle ausführen, die keine Grafikkarte für den Endkundenmarkt allein laden kann. Dieser Leitfaden beleuchtet den praktischen LLM-Einsatz auf dem DGX Spark: welche Modelle in den Speicher passen, die tatsächlichen Inferenzgeschwindigkeiten und den direkten Vergleich mit einer RTX 5090 und einem Mac Studio, damit Sie beurteilen können, ob dieser Mini-PC einen Platz bei Ihnen verdient.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget → · Unser Datenblatt NVIDIA DGX Spark →
Für diese Konfiguration: NVIDIA DGX Spark.
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#Was DGX Spark ist
Der DGX Spark ist ein kompakter Computer auf Basis des NVIDIA GB10 Grace Blackwell Superchips. Er vereint auf einem Chip eine Blackwell-GPU und eine ARM-Grace-CPU (20 Kerne), die an einen gemeinsamen Pool mit 128 GB LPDDR5X-Speicher angebunden sind und diesen gemeinsam nutzen. Diese Architektur mit vereinheitlichtem Speicher — nach demselben Prinzip wie bei Apple Silicon — macht die Maschine für lokale KI so interessant.
Während eine klassische Grafikkarte ihren VRAM getrennt hält (im Consumer-Bereich maximal 24 oder 32 GB), ermöglicht der DGX Spark der GPU, direkt auf die 128 GB zuzugreifen. Konkret fällt die Einschränkung, die beim GPU-Einsatz alle ausbremst – „Passt das Modell in den VRAM?“ –, fast vollständig weg. Zum begrenzenden Faktor wird die Speicherbandbreite, nicht die Kapazität.
- Chip
- NVIDIA GB10 Grace Blackwell (Blackwell-GPU + ARM-CPU mit 20 Kernen)
- Speicher
- 128 GB vereinheitlichter LPDDR5X-Speicher, gemeinsam von CPU und GPU genutzt
- Bandbreite
- ~273 GB/s (LPDDR5X), der echte Engpass
- Netzwerk
- ConnectX (200 GbE) zum Verbinden von zwei Spark-Systemen und für sehr große Modelle
- Format
- Desktop-Mini-PC, ~150 W, leise im Vergleich zu einem Tower mit mehreren GPUs
#128 GB vereinheitlichter Speicher: Was das ermöglicht
Zur Einordnung hier der ungefähre VRAM-Bedarf eines Modells mit Q4_K_M-Quantisierung, der gängigsten Quantisierung für lokale Inferenz: Ein 7B passt in etwa 5 GB, ein 14B in etwa 9 GB, ein 32B in etwa 19 GB und ein 70B in etwa 40 GB. Auf einer RTX 5090 mit ihren 32 GB passt ein 70B in Q4 daher nicht vollständig in den VRAM: Ein Teil muss in den Arbeitsspeicher ausgelagert und auf der CPU verarbeitet werden, wodurch die Geschwindigkeit massiv einbricht.
Mit 128 GB gemeinsamem Speicher lädt der DGX Spark mühelos ein 70B-Modell in Q4, Q5 oder sogar Q8, behält Spielraum für einen langen Kontext (32k Tokens und mehr) und ermöglicht auch Modelle mit 100 Milliarden Parametern oder mehr bei aggressiver Quantisierung. Diese Modellklasse erforderte bislang entweder einen Mac Studio der Spitzenklasse oder ein teures und energiehungriges Multi-GPU-System.
- 70B Q4 (~40 GB)
- Komfortabel, mit reichlich Spielraum für den Kontext
- 70B Q8 (~75 GB)
- Möglich – Qualität nahe FP16 bei einem großen Modell
- MoE-Modell der 120B-Klasse in Q4
- Passt in den Arbeitsspeicher; die Bandbreite bestimmt die Geschwindigkeit
- Mehrere geladene Modelle
- Ein 32B- und ein 14B-Modell parallel für Routing oder Multi-Agent-Systeme
#Welche Modelle darauf laufen
Die Stärke des DGX Spark liegt im Bereich 30B–120B, genau dort, wo Consumer-GPUs wegen fehlenden VRAMs an ihre Grenzen stoßen. Hier sind die typischen Anwendungsfälle nach Modellfamilie.
- Qwen 3.8 27B
- Das führende Allround-Modell von 2026 (Bildverarbeitung, 262k Kontext); auf dieser Maschine läuft es in Q8 bei voller Qualität mit viel Spielraum für den Kontext
- Qwen 3.6 35B-A3B / Qwen3-Coder 30B
- Schnelle MoE-Modelle für Reasoning und Code, die selbst in Q8 vollständig in den Speicher passen
- GLM 4.7 Flash (MoE 30B-A3B, MIT)
- Hervorragend für Agenten, lässt sich ohne Jonglieren in voller Qualität laden
- Großes MoE-Modell mit 100B+ in quantisierter Form
- Mixture-of-Experts-Architekturen profitieren in vollem Umfang vom großen vereinheitlichten Speicher
- Multimodale Modelle
- Die speicherintensiven Modelle Gemma 4 und Qwen 3.8 (Vision + Text) passen ohne Kompromisse in den Speicher
Für kleine Modelle (7B–14B) funktioniert der DGX Spark natürlich, aber dafür ist er verschwendet: Eine RTX 4070 oder ein Mac mini M4 führt sie schneller und für deutlich weniger Geld aus. Die Maschine lohnt sich nur, wenn Sie regelmäßig große Modelle nutzen möchten.
#Tatsächliche Leistung bei der Inferenz
Bei der lokalen Inferenz zählen zwei Kennzahlen: die Generierungsgeschwindigkeit (Tokens pro Sekunde, also das, was auf dem Bildschirm erscheint) und die Prefill-Zeit (die Wartezeit bis zum ersten Token, die von der Länge des Prompts abhängt). Die Speicherbandbreite bestimmt vor allem die Generierungsgeschwindigkeit.
Auf dem DGX Spark generiert ein 70B-Modell in Q4 typischerweise in der Größenordnung von zehn Tokens pro Sekunde — genug für eine komfortable Nutzung als Assistent, bei der Sie die Ausgabe laufend mitlesen, weniger geeignet für Batch-Workloads mit hohem Durchsatz. Kleinere Modelle (14B–32B) erreichen deutlich höhere Werte. Dieses Leistungsprofil passt zu einer Bandbreite von ~273 GB/s: Diese Grenze trennt den DGX Spark von GDDR7-Grafikkarten, die in diesem Punkt deutlich schneller sind.
#DGX Spark im Vergleich zu RTX 5090
Dies ist der anschaulichste Vergleich, und er stellt zwei Philosophien gegenüber. Die RTX 5090 bietet 32 GB GDDR7-VRAM mit einer Bandbreite von etwa 1792 GB/s: Damit ist ihr Speicher etwa sechs- bis siebenmal so schnell wie der des DGX Spark. Bei allem, was in ihre 32 GB passt, ist die 5090 dem Spark bei den Tokens pro Sekunde haushoch überlegen.
Aber die 5090 stößt an eine klare Grenze: Oberhalb von ~32 GB muss sie Teile des Modells auf die CPU auslagern, und ihre Leistung bricht ein. Ein 70B-Modell in Q4 (~40 GB) passt nicht vollständig in ihren Speicher. Der DGX Spark hingegen verarbeitet dasselbe 70B-Modell problemlos – langsamer, aber vollständig auf einem Gerät. Die Entscheidung lässt sich auf eine Frage reduzieren: Benötigt Ihre Arbeitslast weniger als 32 GB?
- Sie bleiben bei ≤ 32 GB (bis zu ~32B in Q4)
- RTX 5090: deutlich schneller und vielseitig (Gaming, Rendering, CUDA)
- Sie möchten Modelle mit 70B Parametern oder mehr nutzen
- DGX Spark: Das Modell passt noch in den Speicher, wenn die 5090 aufgibt
- Stromverbrauch / Geräuschentwicklung
- DGX Spark: ~150 W und leise, gegenüber einem heißen und lauten Tower-PC mit einer 5090
- Vollständiges CUDA-Ökosystem
- Beide; der Spark ergänzt den durchgängigen DGX/NVIDIA-Stack
#DGX Spark im Vergleich zu Mac Studio
Der eigentliche Konkurrent des DGX Spark ist keine Grafikkarte, sondern der Mac Studio. Beide verfolgen dieselbe Idee – sehr viel vereinheitlichter Speicher in einem kompakten, schlichten Gehäuse – und richten sich an dieselbe Zielgruppe: Entwickler, die große Modelle lokal nutzen möchten, ohne einen eigenen Rechner zusammenbauen zu müssen.
Der Mac Studio (M-Ultra) bietet bis zu 512 GB gemeinsamen Speicher und in den High-End-Konfigurationen häufig eine höhere Bandbreite, was ihn bei sehr großen Modellen besonders leistungsfähig macht. Sein Vorteil: macOS, Metal und ein ausgereiftes Ökosystem (Ollama, LM Studio, MLX). Der Vorteil des DGX Spark: native CUDA-Unterstützung. Wenn Ihre Pipeline von CUDA-Bibliotheken, TensorRT oder NVIDIA-Tools abhängt, spricht der Spark von Haus aus dieselbe Sprache wie Ihre Produktionsserver.
- Maximale Speicherkapazität
- Mac Studio mit bis zu 512 GB; DGX Spark mit 128 GB (durch die Verkettung von 2 Geräten erweiterbar)
- Software-Ökosystem
- Mac: ausgereiftes Metal/MLX; Spark: natives CUDA, Kontinuität mit NVIDIA-Servern
- Portabilität des KI-Codes
- Der Spark führt Code, der für NVIDIA-GPUs in der Cloud oder im Rechenzentrum geschrieben wurde, reibungslos aus
- Nutzung für Büroaufgaben
- Der Mac Studio ist ein vollständiger Arbeitsplatz; der Spark ist eine dedizierte KI-Station
#Ollama darauf installieren
Der DGX Spark läuft auf einer Linux-Basis (DGX OS, abgeleitet von Ubuntu) mit vorinstalliertem CUDA-Stack. Ollama funktioniert dort wie auf jedem anderen Linux-Rechner mit NVIDIA-GPU: Der Daemon erkennt die GPU und stellt die Modelle über seinen üblichen Port bereit.
- 01Ollama installierenOffizielles Skript, das mit einem einzigen Befehl ausgeführt wird. Es richtet den systemd-Dienst ein und erkennt die Blackwell-GPU automatisch über CUDA.
- 02GPU-Erkennung überprüfenStellen Sie sicher, dass die GPU korrekt erkannt wird, bevor Sie ein großes Modell starten, sonst würde die Inferenz auf der CPU laufen.
- 03Ein großes Modell herunterladenLaden Sie ein großes MoE-Modell von 2026 in voller Qualität herunter (Qwen3-Coder 30B in Q8 oder das Flaggschiff Qwen 3.8 27B mit seinem Kontext von 262k), um den Speicher auszunutzen – genau dafür ist die Maschine gedacht.
- 04Starten und eine Benutzeroberfläche anbindenDer Daemon lauscht standardmäßig auf http://localhost:11434; konfigurieren Sie Open WebUI oder LM Studio so, dass es diese Adresse verwendet.
Der Ollama-Daemon stellt auf Port 11434 eine kompatible API bereit. Um den Speicher auszunutzen, bevorzugen Sie Modelle, die herkömmliche GPUs nicht allein laden können, und vergrößern Sie das Kontextfenster, da Sie dafür genügend Platz haben. Beachten Sie, dass Qwen 3.8 27B mit seiner standardmäßigen Reasoning-Einstellung dazu neigt, zu lange nachzudenken: Stellen Sie diese auf niedrig (low), um direktere Antworten zu erhalten.
#Ein Chip, acht Maschinen: die zertifizierten Klone
NVIDIA hat den GB10 zu einer Plattform gemacht: Neben der eigenen DGX Spark Founders Edition verkaufen sieben Hersteller dieselbe zertifizierte Basis unter ihrer eigenen Marke. Derselbe Chip, dieselben 128 GB – die Unterschiede liegen beim Massenspeicher, beim Gehäuse, beim Preis und beim Vertriebskanal.
| Rechner | Hersteller | Zusammenfassung |
|---|---|---|
| DGX Spark Founders Edition | NVIDIA | Das Referenzsystem, ca. 3.999 $ |
| Ascent GX10 | Asus | Preislich am günstigsten (~2.999 $) |
| Veriton GN100 | Acer | Eine einzige SKU mit 4 TB Speicherplatz |
| AI TOP ATOM | Gigabyte | Wird mit der AI-TOP-Softwaresuite geliefert |
| EdgeXpert MS-C931 | MSI | Industrieller Kanal/Edge |
| Pro Max GB10 | Dell | Unternehmenskanal |
| ThinkStation PGX | Lenovo | Workstation-Channel |
| ZGX Nano | HP | Workstation-Channel |
Ein Detail, das bei großen Modellen alles verändert: Über den integrierten ConnectX-Port lassen sich zwei Geräte verbinden und Modelle der 400B-Klasse lokal betreiben. Kein anderes Gerät für den Endverbrauchermarkt bietet das.
#Häufig gestellte Fragen
Was genau ist der GB10 des DGX Spark?+
Welche Unterschiede gibt es zwischen dem DGX Spark und seinen Klonen von Asus, Acer oder Gigabyte?+
Kann man ein 400B-Modell wirklich mit zwei Maschinen laufen lassen?+
DGX Spark oder Strix Halo-System?+
Für wen ist eine GB10-Maschine geeignet?+
#Für wen dieses Format sinnvoll ist
Der DGX Spark ist kein Rechner für den Massenmarkt. Er ist vor allem für bestimmte Nutzergruppen interessant, für die der begrenzte VRAM das eigentliche Problem im Alltag ist.
- KI-Entwickler, die mit CUDA arbeiten
- Lokal Prototypen von Code für NVIDIA-GPUs im Produktionsbetrieb entwickeln, ohne Überraschungen bei der Portierung
- Forscher und R&D-Teams
- Leichtes Fine-tuning und Inferenz großer Modelle ohne Cloud-GPU-Zeit zu reservieren
- Power-User von Modellen mit 70 Milliarden Parametern und mehr
- Alle, die ständig an die Speichergrenze von 24–32 GB einer Consumer-Grafikkarte stoßen
- Büros, in denen Geräuschpegel und Stromverbrauch wichtig sind
- Eine leise und sparsame Workstation statt eines Multi-GPU-Rigs
Wenn Sie hingegen spielen, hauptsächlich Modelle mit ≤ 32B ausführen oder ein knappes Budget haben, bietet eine RTX 5090 (oder sogar eine 4070/4080) oder ein Mac mini M4 ein deutlich besseres Preis-Leistungs-Verhältnis. Der DGX Spark lohnt sich, wenn der Bedarf an sehr viel Speicher wichtiger ist als der reine Durchsatz.
#Weiterführende Informationen
Der DGX Spark lässt sich besser einordnen, wenn man ihn mit den Alternativen vergleicht, die bereits auf dieser Website behandelt wurden. Diese Leitfäden führen die Überlegungen weiter:
- Welches LLM läuft auf der RTX 5090 (32 GB)?
- Der ausführliche Vergleich der schnellsten Grafikkarte für den Verbrauchermarkt, um Durchsatz gegen Speicherkapazität abzuwägen.
- Welcher LLM für Mac Studio?
- Die andere große Unified-Memory-Maschine bis zu 512 GB – der echte Konkurrent des DGX Spark.
- GPU für lokale KI auswählen
- Um Ihren VRAM-Bedarf einzuschätzen, bevor Sie Geld ausgeben, und zu sehen, wie die einzelnen Optionen einzuordnen sind.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.