Mittelstufe 14 Min.Mini-PC

NVIDIA DGX Spark: der KI-Mini-PC mit 128 GB im Vergleich zu GPU

Mit dem DGX Spark setzt NVIDIA auf lokale KI am Schreibtisch: ein Grace-Blackwell-Chip, 128 GB vereinheitlichter Speicher und ein Format, das auf eine Tischecke passt. Auf dem Papier kann er Modelle ausführen, die keine Grafikkarte für den Endkundenmarkt allein laden kann. Dieser Leitfaden beleuchtet den praktischen LLM-Einsatz auf dem DGX Spark: welche Modelle in den Speicher passen, die tatsächlichen Inferenzgeschwindigkeiten und den direkten Vergleich mit einer RTX 5090 und einem Mac Studio, damit Sie beurteilen können, ob dieser Mini-PC einen Platz bei Ihnen verdient.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget → · Unser Datenblatt NVIDIA DGX Spark →

Von Samir K.·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Für diese Konfiguration: NVIDIA DGX Spark.

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#Was DGX Spark ist

Der DGX Spark ist ein kompakter Computer auf Basis des NVIDIA GB10 Grace Blackwell Superchips. Er vereint auf einem Chip eine Blackwell-GPU und eine ARM-Grace-CPU (20 Kerne), die an einen gemeinsamen Pool mit 128 GB LPDDR5X-Speicher angebunden sind und diesen gemeinsam nutzen. Diese Architektur mit vereinheitlichtem Speicher — nach demselben Prinzip wie bei Apple Silicon — macht die Maschine für lokale KI so interessant.

Während eine klassische Grafikkarte ihren VRAM getrennt hält (im Consumer-Bereich maximal 24 oder 32 GB), ermöglicht der DGX Spark der GPU, direkt auf die 128 GB zuzugreifen. Konkret fällt die Einschränkung, die beim GPU-Einsatz alle ausbremst – „Passt das Modell in den VRAM?“ –, fast vollständig weg. Zum begrenzenden Faktor wird die Speicherbandbreite, nicht die Kapazität.

Chip
NVIDIA GB10 Grace Blackwell (Blackwell-GPU + ARM-CPU mit 20 Kernen)
Speicher
128 GB vereinheitlichter LPDDR5X-Speicher, gemeinsam von CPU und GPU genutzt
Bandbreite
~273 GB/s (LPDDR5X), der echte Engpass
Netzwerk
ConnectX (200 GbE) zum Verbinden von zwei Spark-Systemen und für sehr große Modelle
Format
Desktop-Mini-PC, ~150 W, leise im Vergleich zu einem Tower mit mehreren GPUs
i
Das ist kein Ersatz für ein Datacenter
Der DGX Spark ist für Prototyping, leichtes Fine-Tuning und die lokale Inferenz großer Modelle gedacht — nicht für Training in großem Maßstab oder den Betrieb unter hoher Last. NVIDIA positioniert ihn als persönliche KI-Entwicklungsstation.

#128 GB vereinheitlichter Speicher: Was das ermöglicht

Zur Einordnung hier der ungefähre VRAM-Bedarf eines Modells mit Q4_K_M-Quantisierung, der gängigsten Quantisierung für lokale Inferenz: Ein 7B passt in etwa 5 GB, ein 14B in etwa 9 GB, ein 32B in etwa 19 GB und ein 70B in etwa 40 GB. Auf einer RTX 5090 mit ihren 32 GB passt ein 70B in Q4 daher nicht vollständig in den VRAM: Ein Teil muss in den Arbeitsspeicher ausgelagert und auf der CPU verarbeitet werden, wodurch die Geschwindigkeit massiv einbricht.

Mit 128 GB gemeinsamem Speicher lädt der DGX Spark mühelos ein 70B-Modell in Q4, Q5 oder sogar Q8, behält Spielraum für einen langen Kontext (32k Tokens und mehr) und ermöglicht auch Modelle mit 100 Milliarden Parametern oder mehr bei aggressiver Quantisierung. Diese Modellklasse erforderte bislang entweder einen Mac Studio der Spitzenklasse oder ein teures und energiehungriges Multi-GPU-System.

70B Q4 (~40 GB)
Komfortabel, mit reichlich Spielraum für den Kontext
70B Q8 (~75 GB)
Möglich – Qualität nahe FP16 bei einem großen Modell
MoE-Modell der 120B-Klasse in Q4
Passt in den Arbeitsspeicher; die Bandbreite bestimmt die Geschwindigkeit
Mehrere geladene Modelle
Ein 32B- und ein 14B-Modell parallel für Routing oder Multi-Agent-Systeme
→
Speicherkapazität ist nicht gleich Geschwindigkeit
Ein Modell zu laden und es schnell auszuführen sind zwei verschiedene Dinge. Die 128 GB garantieren, dass das Modell in den Speicher passt; die Bandbreite von etwa 273 GB/s bestimmt die Tokens pro Sekunde. Bei sehr großen Modellen sollten Sie mit einer Inferenz rechnen, deren Ausgabe sich flüssig mitlesen lässt, nicht mit einer Generierung in rasanten Schüben.

#Welche Modelle darauf laufen

Die Stärke des DGX Spark liegt im Bereich 30B–120B, genau dort, wo Consumer-GPUs wegen fehlenden VRAMs an ihre Grenzen stoßen. Hier sind die typischen Anwendungsfälle nach Modellfamilie.

Qwen 3.8 27B
Das führende Allround-Modell von 2026 (Bildverarbeitung, 262k Kontext); auf dieser Maschine läuft es in Q8 bei voller Qualität mit viel Spielraum für den Kontext
Qwen 3.6 35B-A3B / Qwen3-Coder 30B
Schnelle MoE-Modelle für Reasoning und Code, die selbst in Q8 vollständig in den Speicher passen
GLM 4.7 Flash (MoE 30B-A3B, MIT)
Hervorragend für Agenten, lässt sich ohne Jonglieren in voller Qualität laden
Großes MoE-Modell mit 100B+ in quantisierter Form
Mixture-of-Experts-Architekturen profitieren in vollem Umfang vom großen vereinheitlichten Speicher
Multimodale Modelle
Die speicherintensiven Modelle Gemma 4 und Qwen 3.8 (Vision + Text) passen ohne Kompromisse in den Speicher

Für kleine Modelle (7B–14B) funktioniert der DGX Spark natürlich, aber dafür ist er verschwendet: Eine RTX 4070 oder ein Mac mini M4 führt sie schneller und für deutlich weniger Geld aus. Die Maschine lohnt sich nur, wenn Sie regelmäßig große Modelle nutzen möchten.

i
GB10: ein Superchip aus dem Rechenzentrum für zu Hause
Das Herzstück des Spark ist der GB10 Grace Blackwell: 20 ARM-Kerne (10 Cortex-X925 + 10 A725), die über eine NVLink-C2C-Verbindung fest mit einer Blackwell-GPU verbunden sind, etwa 1 PetaFLOP in FP4 und 128 GB Unified Memory. Das ist buchstäblich die Architektur der GB200-Server, verkleinert auf Taschenbuchformat – mit dem vollständigen CUDA-Ökosystem, das ihn zur einzigen direkten Brücke zwischen „zu Hause experimentieren“ und „wie in einer Produktionsumgebung bereitstellen“ macht.

#Tatsächliche Leistung bei der Inferenz

Bei der lokalen Inferenz zählen zwei Kennzahlen: die Generierungsgeschwindigkeit (Tokens pro Sekunde, also das, was auf dem Bildschirm erscheint) und die Prefill-Zeit (die Wartezeit bis zum ersten Token, die von der Länge des Prompts abhängt). Die Speicherbandbreite bestimmt vor allem die Generierungsgeschwindigkeit.

Auf dem DGX Spark generiert ein 70B-Modell in Q4 typischerweise in der Größenordnung von zehn Tokens pro Sekunde — genug für eine komfortable Nutzung als Assistent, bei der Sie die Ausgabe laufend mitlesen, weniger geeignet für Batch-Workloads mit hohem Durchsatz. Kleinere Modelle (14B–32B) erreichen deutlich höhere Werte. Dieses Leistungsprofil passt zu einer Bandbreite von ~273 GB/s: Diese Grenze trennt den DGX Spark von GDDR7-Grafikkarten, die in diesem Punkt deutlich schneller sind.

!
Vergleichen Sie keine Tokenraten ohne den zugehörigen Kontext.
Eine Angabe in Tokens pro Sekunde ist nur zusammen mit dem genauen Modell, der Quantisierung, der Kontextgröße und der Inferenz-Engine aussagekräftig. Die oben genannten Werte sind Größenordnungen zur Orientierung, keine Garantien. Messen Sie mit Ihrer eigenen Arbeitslast, bevor Sie eine Kaufentscheidung treffen.

#DGX Spark im Vergleich zu RTX 5090

Dies ist der anschaulichste Vergleich, und er stellt zwei Philosophien gegenüber. Die RTX 5090 bietet 32 GB GDDR7-VRAM mit einer Bandbreite von etwa 1792 GB/s: Damit ist ihr Speicher etwa sechs- bis siebenmal so schnell wie der des DGX Spark. Bei allem, was in ihre 32 GB passt, ist die 5090 dem Spark bei den Tokens pro Sekunde haushoch überlegen.

Aber die 5090 stößt an eine klare Grenze: Oberhalb von ~32 GB muss sie Teile des Modells auf die CPU auslagern, und ihre Leistung bricht ein. Ein 70B-Modell in Q4 (~40 GB) passt nicht vollständig in ihren Speicher. Der DGX Spark hingegen verarbeitet dasselbe 70B-Modell problemlos – langsamer, aber vollständig auf einem Gerät. Die Entscheidung lässt sich auf eine Frage reduzieren: Benötigt Ihre Arbeitslast weniger als 32 GB?

Sie bleiben bei ≤ 32 GB (bis zu ~32B in Q4)
RTX 5090: deutlich schneller und vielseitig (Gaming, Rendering, CUDA)
Sie möchten Modelle mit 70B Parametern oder mehr nutzen
DGX Spark: Das Modell passt noch in den Speicher, wenn die 5090 aufgibt
Stromverbrauch / Geräuschentwicklung
DGX Spark: ~150 W und leise, gegenüber einem heißen und lauten Tower-PC mit einer 5090
Vollständiges CUDA-Ökosystem
Beide; der Spark ergänzt den durchgängigen DGX/NVIDIA-Stack

#DGX Spark im Vergleich zu Mac Studio

Der eigentliche Konkurrent des DGX Spark ist keine Grafikkarte, sondern der Mac Studio. Beide verfolgen dieselbe Idee – sehr viel vereinheitlichter Speicher in einem kompakten, schlichten Gehäuse – und richten sich an dieselbe Zielgruppe: Entwickler, die große Modelle lokal nutzen möchten, ohne einen eigenen Rechner zusammenbauen zu müssen.

Der Mac Studio (M-Ultra) bietet bis zu 512 GB gemeinsamen Speicher und in den High-End-Konfigurationen häufig eine höhere Bandbreite, was ihn bei sehr großen Modellen besonders leistungsfähig macht. Sein Vorteil: macOS, Metal und ein ausgereiftes Ökosystem (Ollama, LM Studio, MLX). Der Vorteil des DGX Spark: native CUDA-Unterstützung. Wenn Ihre Pipeline von CUDA-Bibliotheken, TensorRT oder NVIDIA-Tools abhängt, spricht der Spark von Haus aus dieselbe Sprache wie Ihre Produktionsserver.

Maximale Speicherkapazität
Mac Studio mit bis zu 512 GB; DGX Spark mit 128 GB (durch die Verkettung von 2 Geräten erweiterbar)
Software-Ökosystem
Mac: ausgereiftes Metal/MLX; Spark: natives CUDA, Kontinuität mit NVIDIA-Servern
Portabilität des KI-Codes
Der Spark führt Code, der für NVIDIA-GPUs in der Cloud oder im Rechenzentrum geschrieben wurde, reibungslos aus
Nutzung für Büroaufgaben
Der Mac Studio ist ein vollständiger Arbeitsplatz; der Spark ist eine dedizierte KI-Station
i
Das Kriterium, das oft den Ausschlag gibt
Wenn Sie Prototypen für Code entwickeln, der in der Produktion auf NVIDIA-GPUs laufen soll, erspart Ihnen der DGX Spark Überraschungen beim Portieren. Wenn Sie vor allem komfortable lokale Inferenz und einen vielseitigen Rechner möchten, ist der Mac Studio flexibler. Der Rest hängt von der Bandbreite und dem Budget ab.

#Ollama darauf installieren

Der DGX Spark läuft auf einer Linux-Basis (DGX OS, abgeleitet von Ubuntu) mit vorinstalliertem CUDA-Stack. Ollama funktioniert dort wie auf jedem anderen Linux-Rechner mit NVIDIA-GPU: Der Daemon erkennt die GPU und stellt die Modelle über seinen üblichen Port bereit.

  1. 01
    Ollama installieren
    Offizielles Skript, das mit einem einzigen Befehl ausgeführt wird. Es richtet den systemd-Dienst ein und erkennt die Blackwell-GPU automatisch über CUDA.
  2. 02
    GPU-Erkennung überprüfen
    Stellen Sie sicher, dass die GPU korrekt erkannt wird, bevor Sie ein großes Modell starten, sonst würde die Inferenz auf der CPU laufen.
  3. 03
    Ein großes Modell herunterladen
    Laden Sie ein großes MoE-Modell von 2026 in voller Qualität herunter (Qwen3-Coder 30B in Q8 oder das Flaggschiff Qwen 3.8 27B mit seinem Kontext von 262k), um den Speicher auszunutzen – genau dafür ist die Maschine gedacht.
  4. 04
    Starten und eine Benutzeroberfläche anbinden
    Der Daemon lauscht standardmäßig auf http://localhost:11434; konfigurieren Sie Open WebUI oder LM Studio so, dass es diese Adresse verwendet.
Terminal — Installation
# Installer Ollama (Linux / DGX OS)
curl -fsSL https://ollama.com/install.sh | sh

# Vérifier que le GPU Blackwell est détecté
nvidia-smi

# Tirer et lancer un gros MoE 2026 en pleine qualité (exploite la mémoire unifiée)
ollama run qwen3-coder:30b-a3b-q8_0

Der Ollama-Daemon stellt auf Port 11434 eine kompatible API bereit. Um den Speicher auszunutzen, bevorzugen Sie Modelle, die herkömmliche GPUs nicht allein laden können, und vergrößern Sie das Kontextfenster, da Sie dafür genügend Platz haben. Beachten Sie, dass Qwen 3.8 27B mit seiner standardmäßigen Reasoning-Einstellung dazu neigt, zu lange nachzudenken: Stellen Sie diese auf niedrig (low), um direktere Antworten zu erhalten.

Terminal — erweiterter Kontext
# Servir Qwen 3.8 27B avec un grand contexte depuis un Modelfile
cat > Modelfile <<'EOF'
FROM qwen3.8:27b
PARAMETER num_ctx 131072
EOF

ollama create qwen38-128k -f Modelfile
ollama run qwen38-128k
→
Zwei Spark-Geräte miteinander verbinden
Über den ConnectX-Netzwerkanschluss mit 200 GbE lassen sich zwei DGX Spark verbinden, um ihren Speicher zusammenzuführen und Modelle mit einem Speicherbedarf von mehr als 128 GB anzuvisieren. Dies ist der von NVIDIA vorgesehene Upgrade-Pfad, wenn ein einzelnes Gerät nicht mehr ausreicht.

#Ein Chip, acht Maschinen: die zertifizierten Klone

NVIDIA hat den GB10 zu einer Plattform gemacht: Neben der eigenen DGX Spark Founders Edition verkaufen sieben Hersteller dieselbe zertifizierte Basis unter ihrer eigenen Marke. Derselbe Chip, dieselben 128 GB – die Unterschiede liegen beim Massenspeicher, beim Gehäuse, beim Preis und beim Vertriebskanal.

Die 8 zertifizierten GB10-Systeme (August 2026)
RechnerHerstellerZusammenfassung
DGX Spark Founders EditionNVIDIADas Referenzsystem, ca. 3.999 $
Ascent GX10AsusPreislich am günstigsten (~2.999 $)
Veriton GN100AcerEine einzige SKU mit 4 TB Speicherplatz
AI TOP ATOMGigabyteWird mit der AI-TOP-Softwaresuite geliefert
EdgeXpert MS-C931MSIIndustrieller Kanal/Edge
Pro Max GB10DellUnternehmenskanal
ThinkStation PGXLenovoWorkstation-Channel
ZGX NanoHPWorkstation-Channel

Ein Detail, das bei großen Modellen alles verändert: Über den integrierten ConnectX-Port lassen sich zwei Geräte verbinden und Modelle der 400B-Klasse lokal betreiben. Kein anderes Gerät für den Endverbrauchermarkt bietet das.

#Häufig gestellte Fragen

Was genau ist der GB10 des DGX Spark?+
Ein „Superchip“: ein ARM-Grace-Prozessor mit 20 Kernen und eine Blackwell-GPU, die für das Zusammenspiel gefertigt wurden, über NVLink-C2C verbunden sind (deutlich schneller als ein PCIe-Bus) und sich 128 GB vereinheitlichten LPDDR5X-Speicher teilen. Er liefert etwa 1 PetaFLOP in FP4 – die Architektur der KI-Server von NVIDIA im Maßstab eines Mini-PCs.
Welche Unterschiede gibt es zwischen dem DGX Spark und seinen Klonen von Asus, Acer oder Gigabyte?+
Keine Unterschiede beim Chip: Die 8 Systeme verfügen über denselben GB10 und die gleichen 128 GB. Die Unterschiede liegen im Datenspeicher (bis zu 4 TB bei Acer), im Gehäuse, in der mitgelieferten Software, im Support und vor allem im Preis – der Asus Ascent GX10 ist etwa 1.000 $ günstiger als die Founders Edition.
Kann man ein 400B-Modell wirklich mit zwei Maschinen laufen lassen?+
Ja, das ist ein offizieller Anwendungsfall: Zwei Einheiten, die über ihre ConnectX-Ports mit 200 Gb/s verbunden sind, bündeln ihren Speicher, um Modelle der 400B-Klasse bereitzustellen (die sehr großen MoE-Modelle der 400B+-Klasse in quantisierter Form). Das ist im Endkundenbereich einzigartig – die nächste Stufe ist ein Server, der mehrere Zehntausend Euro kostet.
DGX Spark oder Strix Halo-System?+
Beide bieten 128 GB vereinheitlichten Speicher und eine vergleichbare Textgenerierung (ihre Speicherbandbreiten liegen nahe beieinander). Der GB10 liegt bei der Prompt-Verarbeitung, beim Fine-Tuning und beim CUDA-Ökosystem vorn; Strix Halo beim Preis (oft halb so teuer), bei Windows und bei der Vielseitigkeit. Unser spezieller Vergleich entscheidet für jedes Nutzerprofil gesondert – Gesamturteil: Gleichstand.
Für wen ist eine GB10-Maschine geeignet?+
Für KI-Entwickler, die lokal Prototypen dessen erstellen möchten, was sie später in der Produktion auf NVIDIA-Hardware einsetzen werden, für Teams, die Fine-Tuning betreiben, und für diejenigen, die mithilfe von Clustering sehr große Modelle nutzen möchten. Für Chats und Code-Unterstützung im Alltag bietet ein Strix-Halo-Rechner einen ähnlichen Nutzen zum halben Preis.

#Für wen dieses Format sinnvoll ist

Der DGX Spark ist kein Rechner für den Massenmarkt. Er ist vor allem für bestimmte Nutzergruppen interessant, für die der begrenzte VRAM das eigentliche Problem im Alltag ist.

KI-Entwickler, die mit CUDA arbeiten
Lokal Prototypen von Code für NVIDIA-GPUs im Produktionsbetrieb entwickeln, ohne Überraschungen bei der Portierung
Forscher und R&D-Teams
Leichtes Fine-tuning und Inferenz großer Modelle ohne Cloud-GPU-Zeit zu reservieren
Power-User von Modellen mit 70 Milliarden Parametern und mehr
Alle, die ständig an die Speichergrenze von 24–32 GB einer Consumer-Grafikkarte stoßen
Büros, in denen Geräuschpegel und Stromverbrauch wichtig sind
Eine leise und sparsame Workstation statt eines Multi-GPU-Rigs

Wenn Sie hingegen spielen, hauptsächlich Modelle mit ≤ 32B ausführen oder ein knappes Budget haben, bietet eine RTX 5090 (oder sogar eine 4070/4080) oder ein Mac mini M4 ein deutlich besseres Preis-Leistungs-Verhältnis. Der DGX Spark lohnt sich, wenn der Bedarf an sehr viel Speicher wichtiger ist als der reine Durchsatz.

!
Die Falle der magischen Zahl
„128 GB“ klingt beeindruckend, aber mieten Sie diese Kapazität nicht, um ein 8B-Modell zu betreiben. Kaufen Sie diese Maschine für das, was sie wirklich ermöglicht – Modelle im Bereich von 70B bis 120B lokal zu betreiben –, sonst zahlen Sie viel Geld für eine Kapazität, die Sie niemals nutzen werden.

#Weiterführende Informationen

Der DGX Spark lässt sich besser einordnen, wenn man ihn mit den Alternativen vergleicht, die bereits auf dieser Website behandelt wurden. Diese Leitfäden führen die Überlegungen weiter:

Welches LLM läuft auf der RTX 5090 (32 GB)?
Der ausführliche Vergleich der schnellsten Grafikkarte für den Verbrauchermarkt, um Durchsatz gegen Speicherkapazität abzuwägen.
Welcher LLM für Mac Studio?
Die andere große Unified-Memory-Maschine bis zu 512 GB – der echte Konkurrent des DGX Spark.
GPU für lokale KI auswählen
Um Ihren VRAM-Bedarf einzuschätzen, bevor Sie Geld ausgeben, und zu sehen, wie die einzelnen Optionen einzuordnen sind.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.