Mittelstufe 21 Min.Mini-PC

GB10 128 GB: Welche LLMs laufen wirklich? (mesures)

Direkte Antwort

Auf einem GIGABYTE AI TOP ATOM (NVIDIA GB10, 128 GB) laufen die 13 gemessenen Modelle vom 4B bis zum 235B mit 32 768 Kontext-Tokens und mindestens 20 GB Spielraum. Die großen MoE-Modelle, die bei jedem Token nur einen Teil ihrer Parameter aktivieren, sind deutlich schneller als ein gleich großes dichtes Modell: gpt-oss 120B schreibt 58 Tokens pro Sekunde. Ein dichtes 70B-Modell schreibt mit 4,8 Tokens pro Sekunde: Die Speicherdatenrate und nicht der Platz bestimmt die Geschwindigkeit.

Einhundertachtundzwanzig Gigabyte Unified Memory: Das ist der Vorteil der GB10-Rechner gegenüber Grafikkarten. Aber was lässt sich tatsächlich darauf laden, mit welchem Spielraum und mit welcher Geschwindigkeit? Wir haben 13 Modelle vom 4B bis zum 235B auf einem uns freundlicherweise von GIGABYTE bereitgestellten AI TOP ATOM mit einem vor der ersten Messung festgelegten Testprotokoll gemessen. Hier erfahren Sie, was passt, was sich im Alltag angenehm nutzen lässt und für wen der Kauf sinnvoll ist.

Von Mohamed Meguedmi·Aktualisierung 2026-10-08·Gemessen auf GIGABYTE AI TOP ATOM
i
Transparenz
GIGABYTE hat die Hardware für diese Reihe von Anleitungen kostenlos bereitgestellt. Die Messungen und Einschätzungen stammen von uns; GIGABYTE hat diesen Inhalt vor der Veröffentlichung weder gelesen noch freigegeben. Diese Seite enthält keine Affiliate-Links. Unsere Daten, Infografiken und Fotos dürfen unter der CC-BY-4.0-Lizenz frei wiederverwendet werden, sofern quelllm.fr genannt wird.
Die wichtigsten Zahlen
13Modelle
von 4B bis 235B, alle mit 32 768 Tokens Kontext geladen
58tok/s
verfasst von gpt-oss 120B, einem Modell mit 117 Milliarden Parametern
160,3tok/s
insgesamt für 16 gleichzeitige Benutzer auf gpt-oss 120B
20GB
mindestens Spielraum für jedes der 13 Modelle, einschließlich Kontext
Der GIGABYTE AI TOP ATOM von schräg rechts gesehen, flach aufliegend: anthrazitgraue Abdeckung und schwarze Lamellen an der Vorderseite.
Das AI TOP ATOM von GIGABYTE: 1,2 kg und etwa ein Liter für einen NVIDIA-GB10-Chip und 128 GB gemeinsamen Speicher. Foto unseres Geräts, Hintergrund neutralisiert. Vergrößern ↗

#Die getestete Maschine

Datenblatt der getesteten Maschine: GIGABYTE AI TOP ATOM ATAGB10-9000, erfasst am 2026-10-06: NVIDIA-GB10-Chip (Grace Blackwell), 20 Arm-Kerne (10 X925 und 10 A725), 128 GB LPDDR5x-Speicher mit 273 GB/s, 4-TB-SSD über PCIe 5.0 (32 GT/s, 4 Leitungen), 10-GbE-Netzwerk und 2 QSFP-Ports (ConnectX-7, 200 Gb/s), Format 150 × 150 mm, 1 Liter und 1.200 g, 240-W-Netzteil über USB-C, DGX OS 7.5.0
Die per Skript erfasste Konfiguration unseres Geräts vor der ersten Messung, ergänzt durch das GIGABYTE-Datenblatt zu Format und Anschlüssen. Die PCIe-5.0-Verbindung der SSD wurde überprüft (32 GT/s, 4 Lanes). Farben: Blau für den Chip (GB10 und 20 Arm-Kerne); Grün für den Speicher (128 GB) und den Speicherplatz (4-TB-SSD); Grau für Netzwerk, Format, Stromversorgung und Software. Vergrößern ↗

Bei dem Rechner handelt es sich um einen GIGABYTE AI TOP ATOM, Referenz ATAGB10-9000: NVIDIA-GB10-Chip (20 Arm-Kerne und eine Blackwell-GPU, die sich 128 GB Speicher mit angekündigten 273 GB/s teilt), 4-TB-SSD über PCIe 5.0. Er läuft mit DGX OS 7.5.0, dem auf Ubuntu basierenden System von NVIDIA (Treiber 580.159.03, CUDA 13.0).

Drei Softwareprogramme kamen zum Einsatz. llama.cpp, eine weit verbreitete Open-Source-Engine zum lokalen Ausführen von Modellen, die vor Ort für den GB10-Chip kompiliert wurde, liefert die Haupttabelle. Ollama 0.34.1 dient zum Vergleich mit einem MacBook Pro M5 Max, das mit derselben Version gemessen wurde. vLLM 26.09, ein Server, der für die gleichzeitige Beantwortung mehrerer Personen ausgelegt ist, läuft im von NVIDIA bereitgestellten Container.

Schwarze Box des AI TOP ATOM in ihrem Versandkarton, mit Schaumstoff fixiert, mit den Aufschriften GIGABYTE AI TOP und Accelerated by NVIDIA.
Das Auspacken: Der AI TOP ATOM kommt in seiner Schachtel an, mit Schaumstoff fixiert. Unser Gerät wurde am 29. September 2026 entgegengenommen. Vergrößern ↗

#Wie wir gemessen haben

Die Geschwindigkeiten von llama.cpp stammen aus fünf Wiederholungen mit einer Standardabweichung (der Streuung zwischen den Wiederholungen) von höchstens 3 %. Die Ladezeiten, das Lesen eines Dokuments mit 30 000 Tokens und die Speicherspielräume sind Einzelmessungen; die Tests mit mehreren Nutzern werden dreimal wiederholt. Vor der ersten Messung wurde in einem dreiminütigen Test überprüft, ob die GPU ihre Rechenleistung halten konnte.

Die Dateien der 13 Modelle haben einen SHA-256-Fingerabdruck (eine digitale Signatur der Datei), der mit dem von Hugging Face, der Website, auf der diese Modelle gehostet werden, veröffentlichten Fingerabdruck identisch ist. Das am 5. Oktober verfasste Protokoll wurde am 6. um 13:30 Uhr, vor der ersten Messung, eingefroren.

Ein Nachtrag vom selben Tag gegen 16:50 Uhr zog die erneute Kaltmessung auf den Abend vor und ergänzte die hier aufgegriffenen Tests: offizielles Skript von Ollama, spekulatives Decoding, Dauerlast und Llama 3.3 70B in NVFP4. Die Methode, die Dateifingerabdrücke und die Daten unserer Tabellen sind auf unserer Methodenseite veröffentlicht.

Die wichtigsten Werte wurden am selben Abend nach 20 Minuten Ruhezeit und geleertem Cache unter identischen Bedingungen erneut gemessen: höchstens 2,6 % Abweichung, unter dem Protokollgrenzwert von 3 %.

#Fast dieselbe Geschwindigkeit wie ein DGX Spark

Soweit wir wissen, teilen sich die GB10-Maschinen mit 128 GB denselben NVIDIA-Chip und denselben Speicher; ihr Aufbau, ihre Kühlung und ihr Speicher können sich unterscheiden. Um den ATOM einzuordnen, haben wir zwei veröffentlichte Referenzwerte für den DGX Spark von NVIDIA mit derselben Softwareversion und denselben Einstellungen erneut ermittelt.

Mit llama.cpp (Build 7941, dem des vom Projekt veröffentlichten Tabellenblatts; unsere Haupttabelle verwendet den neueren Build 11430) ist die Lesegeschwindigkeit bei sechs gemeinsamen Modellen auf 2,3 % genau gleich; die Schreibgeschwindigkeit liegt im Median um 2,8 % und höchstens um 4,3 % darunter. Mit dem offiziellen Skript von Ollama (Version 0.12.6, der Version seiner veröffentlichten Messungen) liegen unsere drei Messungen beim Lesen wie beim Schreiben innerhalb von 2 %: gpt-oss 20B, gpt-oss 120B und Llama 3.1 70B.

Die Geschwindigkeiten aus diesem Leitfaden sollten daher, bis auf wenige Prozent, auch für die anderen GB10-Rechner mit 128 GB gelten; wir haben nur den ATOM gemessen. Sein Aufbau und sein Verhalten unter Last (Temperaturen, Stabilität nach 1 h und 2 h) werden im nächsten Leitfaden der Reihe ausführlich behandelt, sein Stromverbrauch in einem eigenen Leitfaden.

#13 Modelle, von 4B bis 235B: belegter Platz und Geschwindigkeit

→
Lesen, Schreiben, Tokens und GB
Die Lesegeschwindigkeit gibt an, wie schnell die Maschine Ihre Frage (den „Prompt“) oder Ihr Dokument vor der Antwort verarbeitet; die Schreibgeschwindigkeit, wie schnell die Antwort angezeigt wird. Die erste ist bei langen Dokumenten, Code und Agenten entscheidend, die zweite für den Bedienkomfort. Beide werden in Tokens pro Sekunde angegeben (auf Französisch entspricht ein Token ungefähr zwei Dritteln eines Wortes). Die Speicherangaben erfolgen in Go, wie Linux sie anzeigt: 1 GB = 1 024 MB.

Die Tabelle fasst die Testkampagne zusammen. „Belegter Speicher“ ist der Rückgang des verfügbaren Speichers, sobald das Modell mit reserviertem Kontext von 32.768 Tokens geladen ist. „Laden“ ist die Ladezeit bei kaltem Start und geleertem Festplatten-Cache. Die Geschwindigkeiten stammen aus dem Messwerkzeug llama-bench (llama.cpp, Build 11430 vom 5. Oktober 2026), zunächst bei leerem Kontext und anschließend mit bereits vorhandenen 32.768 Tokens; die tatsächlichen Zeiten für ein langes Dokument stehen weiter unten.

13 Modelle auf dem AI TOP ATOM gemessen, 6. Oktober 2026 (llama.cpp b11430, DGX OS 7.5.0, Treiber 580.159.03). Schreiben und Lesen in Tokens pro Sekunde.
ModellTypBelegter SpeicherChargementSchreiben (leer → 32k)Lesen (leer → 32k)Nutzung
Gemma 3 4B (Q4_0)dense4,6 GB3 s80,8 → 63,66 239 → 5 409sehr flüssig
Qwen2.5-Coder 7B (Q8_0)dense10,2 GB3 s30,0 → 23,33 746 → 2 138fluide
gpt-oss 20B (MXFP4)MoE, 3,6 Mrd. aktive13,0 GB4 s81,4 → 62,54 950 → 3 316sehr flüssig
Qwen3.8 27B (Q4_K_XL)dense19,1 GB5 s11,8 → 10,6865 → 717correct
Qwen3.6 35B-A3B (Q4_K_XL)MoE, 3 Md aktiv22,4 GB5 s66,0 → 55,62 987 → 2 429sehr flüssig
GLM-4.7-Flash (Q8_0)MoE, 3 Md aktiv32,6 GB6 s51,4 → 35,52 392 → 608sehr flüssig
Qwen3-Coder 30B-A3B (Q8_0)MoE, 3,3 Mrd. aktive34,3 GB6 s62,6 → 33,23 377 → 1 603sehr flüssig
Llama 3.3 70B (Q4_K_M)dense51,1 GB8 s4,8 → 3,9405 → 269ideal für die Stapelverarbeitung
gpt-oss 120B (MXFP4)MoE, 5,1 Mrd. aktive61,7 GB10 s58,0 → 42,22 609 → 1 832sehr flüssig
Qwen3.5 122B-A10B (Q4_K_XL)MoE, 10 Mrd. aktive74,5 GB12 s23,1 → 21,41 126 → 945fluide
Nemotron-3 Super 120B-A12B (Q4_K_XL)MoE, 12 Mrd. aktive80,4 GB12 s16,9 → 16,5851 → 809correct
Qwen3.8-Flash-Next 125B (IQ4_XS)MoE, etwa 6 Mrd. aktive89,5 GB21 s27,3 → 25,21 073 → 917fluide
Qwen3-235B-A22B (Q2_K_XL)MoE, 22 Mrd. aktive90,5 GB12 s17,7 → 11,8588 → 331korrekt; starke Kompression (Q2)

So lesen Sie die Tabelle: Ein dichtes Modell verarbeitet bei jedem Token alle seine Parameter, ein MoE-Modell („mixture of experts“) dagegen nur einen Bruchteil, angegeben in Milliarden (Mrd.). Das Kürzel in Klammern bezeichnet die Komprimierung der Gewichte. In unseren Dateien belegt Q8 8,5 Bit pro Parameter, die Formate Q4 und MXFP4 4,3 bis 5,6 Bit und Q2_K_XL 3 Bit: Das ist die stärkste Komprimierung der Tabelle.

Die Spalte „Nutzung“ wendet unsere Richtwerte auf die Schreibgeschwindigkeit bei leerem Kontext an: oberhalb von 40 Tokens pro Sekunde sehr flüssig, von 20 bis 40 flüssig, von 10 bis 20 akzeptabel. Darunter reservieren wir das Modell für Stapelverarbeitungen.

Balkendiagramm der Schreibgeschwindigkeit der 13 Modelle bei leerem Kontext: von 81,4 Tokens pro Sekunde für gpt-oss 20B bis 4,8 für Llama 3.3 70B; MoE-Modelle orange, dichte Modelle blau
Schreibgeschwindigkeit in Tokens pro Sekunde bei leerem Kontext. Orange, mit leuchtendem Symbol aus zwei Kästchen: MoE-Modelle, die für jedes Token nur einen Teil ihrer Parameter aktivieren. Blau, mit ausgefülltem Symbol: dichte Modelle. Bei vergleichbarer Größe sind MoE-Modelle deutlich schneller. Vergrößern ↗

Erste Erkenntnis: Nichts in dieser Tabelle bringt die Maschine in Schwierigkeiten; selbst Qwen3-235B lässt bei 30 000 Kontexttokens 21 GB frei. Zweite, für die Auswahl nützlichere Erkenntnis: Der Speicherplatz ist fast nie der begrenzende Faktor; die Modellwahl bestimmt die Geschwindigkeit – von 4,8 bis 81,4 Tokens pro Sekunde.

#Was die Geschwindigkeit bestimmt: die aktiven Parameter, nicht die Größe

Um jeden Token zu schreiben, muss der Chip die für diesen Token verwendeten Gewichte erneut aus dem Speicher lesen. Bei einer Bandbreite von 273 GB/s lässt sich die maximale Geschwindigkeit einfach berechnen: 273 geteilt durch das Gewichtvolumen, das für jeden Token gelesen wird. Ein dichtes Modell liest jedes Mal alle seine Gewichte; ein MoE-Modell liest nur einen Teil davon, nämlich die für diesen Token ausgewählten „Experten“.

Das erklärt das Paradoxon in der Tabelle. Die Datei von gpt-oss 120B ist 59 GB groß, aber das Modell aktiviert pro Token nur 5,1 Milliarden Parameter: Es schreibt mit 58,0 Tokens pro Sekunde. Qwen3.8 27B, dessen Datei mit 16 GB mehr als dreimal kleiner ist, ist ein dichtes Modell: Es aktiviert bei jedem Token seine 27 Milliarden Parameter und schreibt mit 11,8 Tokens pro Sekunde. Das große Modell ist fast fünfmal schneller als das kleine.

Gemessene Schreibgeschwindigkeit im Vergleich zur theoretischen Obergrenze (273 GB/s ÷ Volumen der aktiven Gewichte, beide in Dezimaleinheiten: 1 GB = 1 Milliarde Byte), bei leerem Kontext. Eigene Berechnung zur groben Orientierung. Aktive Parameter: Modelldatenblätter für MoE-Modelle; von llama.cpp ermittelte Anzahl für dichte Modelle. Anteile anhand der nicht gerundeten Werte berechnet.
ModellAktive ParameterTheoretisches MaximumGemessenAnteil des Grenzwerts
Qwen2.5-Coder 7B (dicht)7,6 Mrd.33,730,089 %
Llama 3.3 70B (dicht)70,6 Mrd.6,44,874 %
Qwen3.8 27B (dicht)27,3 Mrd.15,611,876 %
Qwen3-Coder 30B-A3B (MoE)3,3 Mrd.77,862,681 %
gpt-oss 120B (MoE)5,1 Mrd.98,758,059 %
Qwen3.6 35B-A3B (MoE)3 Mrd.141,166,047 %

Die Tabelle berücksichtigt sechs Modelle, bei denen die Anzahl der aktiven Parameter veröffentlicht oder von llama.cpp ermittelt wurde. Dichte Modelle erreichen 74 bis 89 % dieses Höchstwerts: Die GB10 nutzt fast ihren gesamten Speicher.

Bei allen dreizehn Modellen erreichen die acht MoE-Modelle außerhalb von Qwen3.8-Flash-Next 47 bis 81 %, sechs davon zwischen 52 und 62 %; die Auswahl der Experten und zusätzliche Berechnungen verursachen wahrscheinlich bei jedem Token einen festen Zeitaufwand. Qwen3.8-Flash-Next ist in dieser Berechnung nicht enthalten: Zusätzlich zu seinen 125 Milliarden Parametern verfügt es über 51 Milliarden Parameter für Lookup-Tabellen, wodurch die Schätzung ungeeignet wird.

Bei vergleichbarer Größe bleiben MoE jedoch deutlich schneller. Daher unser wichtigster Rat: Bevorzugen Sie auf einer GB10-Maschine für ein großes Modell ein MoE. Ein kleines dichtes Modell wie Gemma 3 4B schreibt ebenfalls sehr schnell (80,8 Tokens pro Sekunde), ist aber deutlich kleiner und für andere Anwendungsfälle gedacht.

#Modelle mit mehr als 100 Milliarden Parametern

Das ist der Grund für die 128 GB. NVIDIA gibt für die Plattform Modelle mit bis zu 200 Milliarden Parametern an; unsere Messungen bestätigen dieses Versprechen, und ein auf 3 Bit komprimiertes 235B-Modell passt sogar darüber hinaus. Fünf Modelle mit mehr als 100 Milliarden Parametern passen auf den ATOM, alle mit mindestens 20 GB Spielraum bei einem Kontext von 30 000 Tokens.

gpt-oss 120B, der beste Kompromiss zwischen Geschwindigkeit und Platz
58,0 Tokens pro Sekunde, 61,7 GB belegt mit seinem Kontext, in 10 Sekunden geladen. OpenAI veröffentlicht es direkt im MXFP4-Format: Es passt ohne zusätzliche Komprimierung.
Qwen3.8-Flash-Next 125B, das schnellste der riesigen Qwen
27,3 Tokens pro Sekunde mit etwa 6 Milliarden aktiven Parametern, 89,5 GB belegt in IQ4_XS. Auch die weniger stark komprimierte Version Q4_K_XL passt hinein, allerdings mit knappem Spielraum (siehe weiter unten).
Qwen3.5 122B-A10B
23,1 Tokens pro Sekunde, 74,5 GB; seine zehn Milliarden aktiven Parameter setzen es hinter gpt-oss.
Nemotron-3 Super 120B-A12B (NVIDIA)
16,9 Tokens pro Sekunde, 80,4 GB. Mit zwölf Milliarden aktiven Parametern schreibt es langsamer als gpt-oss; zugleich ist es das Modell, dessen Schreibgeschwindigkeit bei längerem Kontext am stabilsten bleibt: 16,5 statt 32 768 Tokens, etwa 3 % weniger.
Qwen3-235B-A22B, separat
Es passt in Q2_K_XL, die stärkste Komprimierung der Tabelle (durchschnittlich 3 Bits pro Parameter): 17,7 Tokens pro Sekunde, 90,5 GB. Eine derart starke Komprimierung verringert im Allgemeinen die Qualität der Antworten; wir haben sie nicht gemessen.

#Wo der Speicher endet: bei etwa 100 bis 105 GB Modellgewicht

Das System erkennt 121,7 GB Speicher: Ein Teil der 128 GB ist bereits beim Start reserviert. Sobald die Maschine gestartet war und sich sonst nichts im Speicher befand, waren je nach Zeitpunkt 108 bis 113 GB verfügbar. Um die Obergrenze zu ermitteln, haben wir zwei schwerere Versionen der größten Modelle geladen, mit demselben Kontext von 32 768 Token und einer Schutzvorrichtung, die den Ladevorgang abbricht, wenn der freie Speicher unter 3 GB fällt.

Die beiden schwersten Ladevorgänge, beide erfolgreich, 6. Oktober 2026 (llama-server b11430, Kontext 32 768 Tokens). Spielraum: noch verfügbarer Speicher, nachdem ein Dokument mit 30 000 Tokens gelesen wurde. „Nur“: ein Spielraum von 5 bis 15 GB.
ModellDateiBelegter SpeicherVerbleibende KapazitätSchreiben (nach dem Lesen von 4 000 → 30 000 Tokens)Place
Qwen3.8-Flash-Next 125B (Q4_K_XL)103,7 GB107,0 GB6,0 GB24,9 → 21,9 Tok/sgenau
Qwen3-235B-A22B (Q3_K_XL, 3,5 Bit)97,0 GB104,7 GB8,2 GB13,9 → 10,4 Tok/sgenau

Keines der Modelle ist beim Laden fehlgeschlagen, aber diese beiden lassen nur wenig Spielraum: kaum Platz für ein zweites Modell, einen deutlich längeren Kontext oder eine anspruchsvolle Anwendung daneben. Die praktische Grenze liegt daher bei etwa 100 bis 105 GB Modellgewicht. Ausgeschlossen sind beispielsweise die NVFP4-Gewichte (ein komprimiertes Format von NVIDIA) von Qwen3.8-Flash-Next: laut dem Kubesimplify-Blog (27. August 2026) etwa 135 GB; dort wird darauf hingewiesen, dass dafür zwei Rechner erforderlich sind.

Dieser Beitrag zeigte das Modell bereits auf einer einzigen Maschine im GGUF-Format (dem Format von llama.cpp), damals existierte jedoch nur die am stärksten komprimierte Version. Auf dem ATOM laufen die Versionen IQ4_XS und Q4_K_XL mit 21 bzw. 6 GB Spielraum.

→
Die richtige Größe für eine komfortable Nutzung
Planen Sie für Ihren Kontext höchstens ungefähr 90 GB ein: Dann bleiben etwa zwanzig GB für das System, ein zweites kleines Modell oder einen längeren Kontext. Unsere dreizehn Modelle halten diese Richtgröße ein.

#Der Preis des langen Kontexts

Ein langes Dokument, eine Codebasis oder eine sich hinziehende Unterhaltung: Jeder Token, der bereits im Kontext vorhanden ist, verlangsamt den weiteren Verlauf. Bei 32 768 Tokens im Speicher sinkt die Schreibgeschwindigkeit je nach Modell um 3 bis 47 %. Wir haben außerdem die tatsächliche Zeit gemessen, die benötigt wird, um ein Dokument mit 30 000 Tokens, etwa fünfzig Seiten, am Stück zu lesen.

Zeit zum vollständigen Lesen eines Dokuments mit 30 000 Tokens (llama-server b11430, 6. Oktober 2026), anschließend Schreibgeschwindigkeit der Antwort.
ModellLesen von 30 000 TokensDanach schreiben
Gemma 3 4B4,7 s60,8 Tok/s
gpt-oss 20B8,1 s61,6 Tok/s
Qwen2.5-Coder 7B12,7 s23,3 Tok/s
Qwen3.6 35B-A3B14,2 s54,4 Tok/s
Qwen3-Coder 30B-A3B17,4 s33,3 Token/s
gpt-oss 120B21,8 s42,8 Tok/s
GLM-4.7-Flash32,7 s35,6 Tok/s
Qwen3.8 27B39,4 s10,6 Tok/s
Qwen3.8-Flash-Next 125B42,9 s23,0 Tok/s
Qwen3.5 122B-A10B43,6 s21,2 Tok/s
Nemotron-3 Super 120B-A12B55,4 s16,2 Tok/s
Qwen3-235B-A22B1 Min. 33 Sek.12,1 Tok./s
Llama 3.3 70B1 Min. 44 Sek.4,0 Tok/s

Bei den meisten Modellen sind diese Zeiten länger, als die Spalte „Lesen“ der ersten Tabelle vermuten lässt. Der wahrscheinliche Grund: llama-server, der praktisch verwendete Server, verarbeitet Text standardmäßig in Stapeln von 512 Tokens statt 2.048 wie in unserer llama-bench-Konfiguration.

Kurven der Schreibgeschwindigkeit in Abhängigkeit vom bereits vorhandenen Kontext, von 0 bis 32.768 Tokens: eine Farbe pro Modell: gpt-oss 120B von 58,0 bis 42,2, Qwen3.6 35B-A3B von 66,0 bis 55,6, Qwen3-Coder 30B-A3B von 62,6 bis 33,2, Nemotron-3 Super 120B von 16,9 bis 16,5, Qwen3.8 27B von 11,8 bis 10,6, Llama 3.3 70B von 4,8 bis 3,9
Schreibgeschwindigkeit in Token pro Sekunde abhängig vom bereits vorhandenen Kontext, von 0 bis 32 768 Token (horizontale Achse in Tausend Token). Eine Farbe pro Modell; der Name steht rechts neben jeder Kurve. Das Dokumentsymbol mit « → 32 768 » erinnert an den gemessenen maximalen Kontext. Nemotron (−3 %) und Qwen3.8 27B (−10 %) behalten fast ihre gesamte Geschwindigkeit; bei 32 768 Token im Speicher schreibt gpt-oss 120B noch 42 Token pro Sekunde und Qwen3.6 35B-A3B fast 56. Vergrößern ↗

Das Lesen ist eine Stärke der GB10: Im Vergleich zum weiter unten getesteten Mac liest sie gpt-oss 120B 31 % schneller. Wenn Sie einen Bericht mit etwa fünfzig Seiten ablegen, beginnt die Antwort mit gpt-oss 120B 22 Sekunden später und mit einem dichten 70B-Modell 1 min 44 s später. Für die Dokumentenanalyse und Code-Agenten ist dieses Kriterium von großer Bedeutung.

#Bis zu 16 Nutzer gleichzeitig: Was die Maschine bewältigt

Mit vLLM haben wir 1, dann 8 und anschließend 16 gleichzeitige Benutzer simuliert. Jeder sendet eine Anfrage mit 1 024 Tokens und erhält eine Antwort mit 512 Tokens; jeder Punkt wird dreimal mit unterschiedlichen Anfragen gemessen, und wir veröffentlichen den Median.

Mehrere gleichzeitige Nutzer, vLLM 26.09 (Container NVIDIA), 6. Oktober 2026. „Pro Person“: Schreibgeschwindigkeit, sobald die Antwort gestartet wurde. „Gesamt“: pro Sekunde für alle Nutzer geschriebene Tokens, einschließlich der Wartezeit bis zum ersten Wort. „Langsamste Fälle“: 99. Perzentil, also die Dauer, innerhalb derer 99 von 100 Anfragen abgeschlossen werden, berechnet über 4 bis 64 Anfragen pro Serie und daher nahe am beobachteten Maximum.
ModellBenutzerTotalPro PersonErstes Wort (Durchschnitt)Erstes Token (langsamste Fälle)
gpt-oss 120B135,6 Tok/s36,4 Tok/s0,34 s0,35 s
gpt-oss 120B8113,9 Tok/s14,5 Tok/s0,97 s1,62 s
gpt-oss 120B16160,3 Tok/s10,2 Tok/s1,07 s3,71 s
gpt-oss 20B149,1 Tok/s50,0 Tok/s0,16 s0,16 s
gpt-oss 20B8205,9 Tok/s26,5 Tok/s0,49 s0,81 s
gpt-oss 20B16322,4 Tok/s20,7 Tok/s0,52 s1,73 s
Kurven für den Gesamtdurchsatz und den Durchsatz pro Person bei 1, 8 und 16 gleichzeitigen Benutzern: gpt-oss 120B steigt insgesamt von 35,6 auf 160,3 Tokens pro Sekunde, bei 16 Benutzern 10,2 pro Person; gpt-oss 20B steigt insgesamt von 49,1 auf 322,4, bei 16 Benutzern 20,7 pro Person
Token-Durchsatz pro Sekunde für 1, 8 und 16 gleichzeitige Benutzer (vLLM). Violett: gpt-oss 20B; orange: gpt-oss 120B. Unter der horizontalen Achse steht eine Silhouette für einen Benutzer, eine Gruppe für mehrere Benutzer. Durchgezogene Linien, Gruppensymbol: Gesamtdurchsatz. Gestrichelte Linien, Personensymbol: von jeder Person wahrgenommene Geschwindigkeit. Bei 16 Benutzern überschreitet gpt-oss 20B insgesamt 320 Tokens pro Sekunde. Vergrößern ↗

Bei 1 bis 16 Nutzern wird der Gesamtdurchsatz mit gpt-oss 120B um das 4,5-Fache und mit gpt-oss 20B um das 6,6-Fache erhöht: Wenn mehrere Anfragen dieselben Gewichtungen gemeinsam nutzen, schöpft der Chip seine Rechenleistung voll aus.

Bei 16 Personen sieht jede einzelne ihre Antwort mit gpt-oss 120B weiterhin mit 10 Tokens pro Sekunde entstehen, mit gpt-oss 20B mit 21. Beim Modell mit 120 Milliarden Parametern kommt das erste Wort im Durchschnitt nach etwas mehr als einer Sekunde, in den langsamsten Fällen nach fast 4 Sekunden.

Für eine einzelne Person ist vLLM dagegen nicht am schnellsten: Ohne besondere Leistungsoptimierung schreibt es mit 36,4 Tokens pro Sekunde auf gpt-oss 120B, gegenüber 54,4 für llama.cpp bei langen Antworten. Die Protokolle zeigen, dass es auf der GB10 den Marlin-Rechenkern für das MXFP4-Format auswählt, was den Unterschied wahrscheinlich erklärt. vLLM lohnt sich, sobald mehrere Personen oder mehrere Agenten die Maschine gemeinsam nutzen.

#Allein vor dem Rechner: Ollama oder llama.cpp?

Ollama ist der einfachste Einstieg und funktioniert ohne Anpassungen auf der GB10. Auf gpt-oss ist es jedoch nicht das schnellste. Bei langen Antworten schreibt Version 0.34.1 mit 42,3 Tokens pro Sekunde auf gpt-oss 120B, gegenüber 54,4 für llama.cpp im selben MXFP4-Format, also 22 % weniger. Auf gpt-oss 20B: 58,8 gegenüber 78,8, also 25 % weniger.

Bei den Qwen-Modellen ist es umgekehrt. Auf Qwen3.8 27B schreibt Ollama je nach Abschnitt zwischen 22,9 und 30,5 Tokens pro Sekunde, gegenüber 11,8 bei llama.cpp mit Standardeinstellungen; auf Qwen3.6 35B-A3B zwischen 90,5 und 94,9, gegenüber 66,0. Der wahrscheinliche Grund: Ollama aktiviert dort standardmäßig eine spekulative Dekodierung, bei der mehrere Tokens im Voraus vorgeschlagen werden, die das Modell auf einmal bestätigt (die Einstellung draft_num_predict erscheint in der Konfiguration dieser Modelle).

Unser Test bestätigt dies. Auf llama-server (sechs Texte mit 400 Tokens, Prosa und Code) steigert das spekulative Decoding von llama.cpp (MTP, das mehrere Tokens gleichzeitig vorhersagt) Qwen3.8 27B bei Prosa von 11,7 auf 21,5 Tokens pro Sekunde und bei Code von 11,6 auf 27,2.

→
Ollama öffnet standardmäßig lange Kontexte
Ohne unser Zutun hat Ollama 0.34.1 Kontextfenster mit 131 072 Tokens für gpt-oss und mit 262 144 für Qwen und Gemma geöffnet, obwohl die Dokumentation standardmäßig 4 096 angibt. Der von ihm gemeldete Speicherbedarf bleibt nahe an unseren Messwerten. Um Platz für ein zweites Modell zu behalten, verringern Sie den Kontext mit der Variable OLLAMA_CONTEXT_LENGTH.

In der Praxis: Ollama zum Starten und für die Modelle Qwen, die es standardmäßig beschleunigt; llama.cpp, um das Maximum aus gpt-oss herauszuholen oder bei aktiviertem spekulativem Dekodieren aus Qwen3.8. Die beste Wahl hängt stärker von den Einstellungen als von der Maschine ab.

#Im Vergleich zum MacBook Pro M5 Max 128 GB

Ein Leser hat sein MacBook Pro M5 Max mit 128 GB (GPU mit 40 Kernen) am 16. September mit Ollama 0.34.1 in einem einzigen Durchlauf pro Modell vermessen; seine Messwerte sind in unserem speziellen Leitfaden veröffentlicht. Wir haben dieselben Serien auf dem ATOM in zwei Durchläufen erneut ausgeführt: dieselbe Version von Ollama, dieselben Modelle, derselbe Prompt.

Gleiche Version von Ollama (0.34.1), gleiche Modelle, gleicher Prompt. Schreiben in Tokens pro Sekunde; Lesen eines Dokuments mit etwa 17.000 Tokens für die letzte Zeile. Mac: ein Durchlauf, gemessen von einem Leser am 16. September 2026. ATOM: zwei Durchläufe, am 6. Oktober 2026.
MessungATOM, 1. DurchlaufATOM, 2. DurchlaufMacBook Pro M5 MaxAbweichung
Schreiben, gemma4:12b45,954,158,1Mac +7 bis +27 %
Schreiben, qwen3.8:27b30,522,936,6Mac +20 bis +59 %
Schreiben, gpt-oss:20b58,158,8113,4Mac +93 bis +95 %
Schreiben, gpt-oss:120b42,242,379,1Mac +87 %
Lektüre, gpt-oss:120b1 816—1 388ATOM +31 %

Der Mac schreibt bei allen vier Modellen schneller, bei den beiden gpt-oss-Modellen fast doppelt so schnell, deren Durchläufe übereinstimmen: Sein Chip verfügt über eine Bandbreite von 614 GB/s, mehr als das Doppelte der GB10. Bei gemma4 und qwen3.8 variiert der Abstand von einem Durchlauf zum nächsten; spekulatives Dekodieren, dessen Gewinn vom generierten Text abhängt, ist eine mögliche Erklärung.

Die ATOM liest wahrscheinlich dank der Rechenleistung ihrer GPU schneller, und zwar bei ähnlichen, aber nicht identischen Texten (16 850 und 16 689 Tokens). Mit llama.cpp verringert sich der Abstand bei der Ausgabe: 54,4 Tokens pro Sekunde auf gpt-oss 120B gegenüber 79,1 beim Mac unter Ollama.

#Für wen der ATOM die richtige Wahl ist

Das Folgende stammt aus unseren Messungen auf dem ATOM.

ATOM ist die richtige Wahl, wenn Sie große Modelle zu Hause ausführen möchten
Fünf Modelle mit mehr als 100 Milliarden Parametern finden mit Reserve Platz. Nach unserem Kenntnisstand kommt keine Grafikkarte für den Massenmarkt diesen 128 GB nahe.
… wenn Sie an langen Dokumenten oder Code arbeiten
30 000 gelesene Tokens in 22 Sekunden mit gpt-oss 120B.
… wenn mehrere Personen oder Agenten sie gemeinsam nutzen
Insgesamt 160 Tokens pro Sekunde für 16 Benutzer auf gpt-oss 120B.
… wenn Sie das NVIDIA-Ökosystem möchten
CUDA 13, vLLM im Container von NVIDIA und für den GB10-Chip kompiliertes llama.cpp haben bei uns unter DGX OS 7.5.0 funktioniert.
Wenn Sie allein arbeiten und zunächst auf Schreibgeschwindigkeit abzielen
Vergleichen Sie mit dem MacBook Pro M5 Max: Dank seiner 614 GB/s schreibt es schneller auf gpt-oss, während der ATOM ein langes Dokument auf gpt-oss 120B 31 % schneller liest. Vergleichen Sie auch die Preise.
Wenn Ihre Modelle unter 35 GB bleiben
Die für den 23. Oktober 2026 angekündigte 64-GB-Version der ATOM sollte ausreichen (Berechnung aus unseren Messungen, auf dieser Version nicht gemessen).

#64 oder 128 GB?

Am 2. Oktober 2026 kündigte NVIDIA DGX-Spark-Geräte mit 64 GB für Modelle mit bis zu 100 Milliarden Parametern an, die ab dem 23. Oktober bei Acer, ASUS, Dell, GIGABYTE, HP und MSI ab 4.999 Dollar erhältlich sein sollten. GIGABYTE bestätigte am 5. Oktober eine AI TOP ATOM 64 GB im selben Design. Wir haben sie nicht gemessen.

Unsere Messwerte ermöglichen eine Berechnung. Modelle bis Qwen3-Coder 30B-A3B belegen mit 32 768 Kontext-Token weniger als 35 GB und würden passen; Llama 3.3 70B (51 GB) läge an der Grenze. gpt-oss 120B (62 GB) und größere Modelle würden nicht passen. Bei gleicher Bandbreite – was noch überprüft werden muss – sollten die Geschwindigkeiten ähnlich sein.

Für ein Modell mit mehr als 100 Milliarden Parametern auf einer einzigen Maschine ist die 128-GB-Version die richtige Wahl. Laut NVIDIA teilen sich auch zwei miteinander verbundene Maschinen mit jeweils 64 GB ihren Speicher; wir haben das nicht getestet.

#Die erhobenen Preise

Am 8. Oktober 2026 wurde die 4-TB-Version mit PCIe 4.0 (ATAGB10-9001, derselbe GB10-Chip und dieselben 128 GB) im offiziellen AORUS-Shop für 6 346,27 € inklusive Mehrwertsteuer angezeigt, war jedoch ausverkauft; auf Amazon.fr war sie auf Lager und wurde von Amazon UK verkauft (ein Exemplar). Die getestete Version, 4 TB mit PCIe 5.0 (ATAGB10-9000), kostete bei LDLC und Materiel.net 7 999,95 € und war nicht verfügbar.

Preise und Lagerbestände dieser Geräte ändern sich schnell: Überprüfen Sie sie vor dem Kauf.

#Unser Urteil

Der ATOM ist eine ausgezeichnete Wahl, um zu Hause ein Modell mit 120 Milliarden Parametern zu betreiben, es mit einem Team zu teilen oder lange Dokumente schnell zu lesen. Er lieferte uns die Referenzleistung der Plattform, ohne dass unsere Messungen eine thermische Begrenzung zeigten, auch nicht während einer Stunde Dauerlast mit 16 Benutzern. Wenn das Budget eine Rolle spielt, behält die PCIe-4.0-Version denselben Chip und denselben Speicher.

#Was wir nicht gemessen haben

Die Qualität der Antworten
Dieser Leitfaden misst, was funktioniert und wie schnell, nicht, wie gut jedes Modell ist.
Temperaturen, Geräuschpegel und Stromverbrauch
Der nächste Leitfaden der Reihe behandelt die Temperaturen bei längerer Belastung; der Stromverbrauch hat einen eigenen Leitfaden und wird am Chip abgelesen (nur GPU). Beim Geräuschpegel zitieren wir die Messungen von Hardware & Co.
Kontexte mit mehr als 32.768 Tokens
Mehrere Modelle akzeptieren deutlich längere Kontexte; dieser Leitfaden endet bei 32 768 Tokens, und das 70B-Tutorial der Reihe reicht für Llama 3.3 70B und gpt-oss 120B bis 131 072 Tokens.
Die anderen GB10-Maschinen und die 64-GB-Version
Unsere Zahlen entsprechen den für den DGX Spark von NVIDIA veröffentlichten Werten, aber wir haben nur den ATOM 128 GB gemessen.

Aktualisierungen und Korrekturen: Diese Seite wird überarbeitet, falls eine neue Version von DGX OS, llama.cpp oder Ollama diese Ergebnisse verändert; jede Korrektur wird datiert.

#FAQ

FAQ
Welches ist das größte Modell, das man auf einem 128-GB-GB10-System ausführen kann?+
Auf unserem AI TOP ATOM ist Qwen3-235B-A22B das größte getestete Modell: 90,5 GB belegt in Q2_K_XL (3 Bit pro Parameter) und 21 GB Spielraum bei 30.000 Kontext-Tokens. Auch die Q3_K_XL-Version passt hinein, mit 8 GB Spielraum. Wir haben die Antwortqualität nicht gemessen: Mit 3 Bit weicht ein Modell stärker von seiner ursprünglichen Version ab als mit 4 oder 5 Bit, aber daraus lässt sich nicht ableiten, welches besser antwortet.
Ist ein 70B-Modell im Alltag auf einer GB10 nutzbar?+
Er bewältigt dies problemlos (51 GB belegt) und schreibt 4,8 Tokens pro Sekunde; 30.000 Tokens liest er in 1 min 44 s. Für die Stapelverarbeitung ist er ideal: In der NVFP4-Version unter vLLM erreichen acht gleichzeitige Anfragen insgesamt 37,7 Tokens pro Sekunde, und jede Antwort wird nach ihrem Beginn mit 5,0 Tokens pro Sekunde geschrieben. Ein kleines Entwurfsmodell bringt ihn auf 12 Tokens pro Sekunde (siehe unser 70B-Tutorial). Im Dialog ist gpt-oss 120B deutlich angenehmer.
Gelten die Geschwindigkeiten dieses Leitfadens für einen DGX Spark von NVIDIA oder eine andere Marke?+
Sehr wahrscheinlich, bis auf wenige Prozent, aber wir haben nur den ATOM gemessen. Soweit wir wissen, verfügen die 128-GB-GB10-Systeme über denselben Chip und denselben Speicher. Beim erneuten Ausführen von zwei veröffentlichten Referenzwerten für den DGX Spark, mit llama.cpp und mit Ollama, weichen unsere Lesegeschwindigkeiten um höchstens 2,3 % ab und unsere Schreibgeschwindigkeiten um höchstens 4,3 %.
Sollten Sie die Version mit 64 GB oder 128 GB wählen?+
Wenn Ihre Modelle einschließlich ihres Kontexts weniger als 35 GB belegen, wie gpt-oss 20B oder Qwen3.6 35B-A3B in unseren Messungen, sollte die 64-GB-Version ausreichen; das ist eine Berechnung, wir haben sie nicht gemessen. Für ein Modell mit mehr als 100 Milliarden Parametern auf einer einzigen Maschine, wie gpt-oss 120B (62 GB), ist die 128-GB-Version erforderlich.
Ist Ollama die beste Wahl auf einer GB10?+
Für den Einstieg ja: Es funktioniert ohne Anpassungen. Auf gpt-oss 120B schreibt llama.cpp jedoch schneller (54,4 gegenüber 42,3 Tokens pro Sekunde bei langen Antworten). Bei den Modellen Qwen liegt Ollama mit seinen Standardeinstellungen vorn, wahrscheinlich dank der aktivierten spekulativen Dekodierung; llama.cpp kommt näher heran, wenn Sie seine spekulative Dekodierung aktivieren. Die beste Wahl hängt daher vor allem von den Einstellungen ab.
In derselben Serie
Die MaschineDas Datenblatt der GIGABYTE AI TOP ATOM
Guide 2 · erscheint demnächstAI TOP ATOM vs DGX Spark
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.