Mittelstufe 14 Min.Apple

MacBook Pro M5 Max 128 GB: die tatsächlichen Messwerte für lokale KI (Benchmark 2026)

Ein MacBook Pro M5 Max mit 40 GPU-Kernen und 128 GB Unified Memory, ein im Voraus verfasstes Protokoll, sechs Modelle, ein Dokument mit 16 689 Tokens: Hier sind die ersten öffentlichen Messwerte zum größten tragbaren Apple im Bereich der lokalen KI. Die Messungen wurden von Joël Ramat, einem Berater für Cybersicherheit und GRC, auf seinem eigenen Gerät, auf unsere Anfrage und nach unserem Protokoll durchgeführt. Alle Zahlen sind die unveränderten Rohdaten von Ollama.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-16·Getestet auf macOS 14+
Empfohlene Hardware

Das MacBook Pro M5 Max ist heute auf Lager: MacBook Pro M5 Max — 36 GB / 2 TB.

Warum diese Wahl? Unsere vollständige Übersicht zu MacBook Pro M5 Max — 36 GB / 2 TB →

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.

Aufgeklapptes MacBook Pro auf einem dunklen Schreibtisch, mit einem Terminal, das eine laufende Textgenerierung anzeigt
Illustration. Das getestete Gerät ist ein serienmäßiges MacBook Pro M5 Max mit 128 GB, bei dem keine Systemeinstellungen verändert wurden.
i
Warum dieser Leitfaden existiert
Der M5 Max mit 128 GB ist die einzige Konfiguration im oberen Bereich unseres Konfigurators, für die wir keine Messdaten aus erster Hand erheben konnten. Joël Ramat, Leser des Mac-Kits und Besitzer des Rechners, bot an, die Messungen durchzuführen. Wir haben das Protokoll verfasst, er hat es am 16. September 2026 umgesetzt, und wir veröffentlichen hier seine Ergebnisse und nennen ihn als Urheber der Messungen.

#Die Maschine und das Protokoll

Technische Daten des Rechners: M5-Max-Chip, 40 GPU-Kerne, 18 CPU-Kerne, 614 GB/s, 128 GB gemeinsamer Speicher, macOS 27.0, Ollama 0.34.1
Die genaue Konfiguration, die vor der ersten Messung per Skript erfasst wurde. Die Anzahl der GPU-Kerne ist entscheidend: Nur die Variante mit 40 Kernen erreicht 614 GB/s.

Das Gerät ist ein 16-Zoll-MacBook Pro mit dem voll ausgebauten M5-Max-Chip: 18 CPU-Kerne, 40 GPU-Kerne und 128 GB vereinheitlichter Speicher mit einer angegebenen Bandbreite von 614 GB/s. Es läuft unter macOS 27.0 mit Ollama 0.34.1. Es wurden keine Systemeinstellungen verändert: Die GPU-Speichergrenze entspricht dem Standardwert, was für den Vergleich mit Ihrem eigenen Mac wichtig ist.

Das Protokoll umfasst vier Regeln, und diese sind keineswegs bloß Beiwerk. Der Mac ist ans Stromnetz angeschlossen, weil macOS den Chip im Akkubetrieb drosselt. Ressourcenintensive Anwendungen sind geschlossen. Es ist jeweils nur ein Modell geladen. Und vor allem wird für alle Messreihen derselbe Prompt verwendet, damit die Zahlen zwischen Modellen und künftig auch zwischen Rechnern vergleichbar sind.

Der gemeinsame Prompt für alle Serien
Explique en 300 mots la différence entre la mémoire unifiée d'un Mac et la VRAM d'un GPU dédié, pour un lecteur non technique.
Serie A, die beiden Referenzen
Gemma 4 12B und Qwen 3.8 27B im GGUF-Format, zwei Modelle, die auch auf deutlich bescheidener ausgestatteten Macs laufen. Sie ermöglichen es, die Maschine auf einer bekannten Skala einzuordnen.
Serie B, MLX gegenüber GGUF
Dasselbe Qwen 3.8 27B, dieselben Modellgewichte, bereitgestellt über Ollamas MLX-Engine statt über llama.cpp. Nur die Engine ändert sich.
Serie C: der eigentliche Schwerpunkt bei der 128-GB-Stufe
gpt-oss 120B, 65 GB, ein Modell, das schlicht nicht in den Speicher eines PC-Laptops passt.
Serie D: Prefill unter realer Last
Ein Dokument mit 16.689 Tokens wurde in einem Stück an gpt-oss 120B gesendet, mit der Anweisung, eine Zusammenfassung zu erstellen. Dies ist die einzige aussagekräftige Prefill-Messung der Testkampagne.
Zwei zusätzliche Messungen außerhalb des Testprotokolls
Joël hatte bereits Qwen 3.6 35B-A3B in MLX und gpt-oss 20B auf seinem Gerät. Er hat sie unter den gleichen Bedingungen gemessen.
→
Das, was gemessen wird, und das, was man nicht verwechseln sollte
Ollama zeigt zwei Durchsatzwerte an. Prefill (prompt eval rate) bezeichnet die Geschwindigkeit, mit der das Modell Ihren Prompt liest, bevor es antwortet: Dieser Vorgang bestimmt die Wartezeit bis zum ersten Wort. Die Generierung (eval rate) ist die Ausgabe der Antwort, Token für Token: Sie bestimmt, wie flüssig die Ausgabe wirkt. Ein Modell kann beim einen schnell und beim anderen langsam sein.

#Alle Zahlen in einer Tabelle

Das Mac-Kit

Lokale KI auf Ihrem Mac voll ausschöpfen: Unified Memory, MLX vs. GGUF, das passende Modell für Ihren Chip und auf Apple Silicon abgestimmte Einstellungen für Ollama und LM Studio.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Hier sind die unveränderten Ausgaben des Befehls ollama run --verbose, so wie Joël sie nach jeder Messung kopiert hat. Jedes Modell hat eine vollständige Antwort auf den 300-Wörter-Prompt erzeugt, im Reasoning-Modus, sofern das Modell darüber verfügt. Das erklärt die 1.400 bis 3.200 generierten Tokens für 300 Wörter endgültigen Text.

M5 Max 40 GPU · 128 GB · Ollama 0.34.1 · Netzbetrieb · zwei Durchläufe pro Modell, zweiter beibehalten · 16/09/2026
ModellEngineModellgrößeGenerierungErzeugte TokensGesamtdauer
Gemma 4 12BGGUF Q47,6 GB58,1 Tok/s1 39024 s
Qwen 3.8 27BGGUF Q417 GB36,6 Tok/s2 51769 s
Qwen 3.8 27BMLX18 GB68,0 Tok/s2 10331 s
Qwen 3.6 35B-A3B (Bonus)MLX23 GB167,2 Tok/s3 20519 s
gpt-oss 20B (Bonus)MXFP413 GB113,4 Tok/s2 19919 s
gpt-oss 120BMXFP465 GB79,1 Tok/s6698,5 s
gpt-oss 120B, Wiederholung 1MXFP465 GB77,5 Tok/s73212,5 s
gpt-oss 120B, Neustart 2MXFP465 GB75,5 Tok/s1 70722,7 s
gpt-oss 120B, Serie DMXFP465 GB67,6 Tok/s2 58450 s
Prefill: Nur die Messung der Serie D ist aussagekräftig (siehe Abschnitt Grenzen)
SeriePrompt-TokensPrefillZeit bis zum ersten Wort
A, B, C (kurzer Prompt)43 à 9831 bis 346 Tok/s0,1 bis 0,9 Sekunden: Startlatenz, kein Durchsatz
D, Dokument mit 16.689 Tokens16 6891 388 Tok/s12,0 s
!
Warum die Prefill-Werte bei kurzen Prompts nicht kommentiert werden
Jedes Modell wurde zweimal gemessen, und gemäß dem Protokoll wird nur der zweite Durchgang berücksichtigt: Das Laden des Modells und die Kompilierung der Metal-Shader liegen daher außerhalb der Messung. Bei einem Prompt mit 43 bis 98 Tokens dauert der Prefill jedoch weniger als eine Sekunde: Der Wert spiegelt eine feste Startlatenz wider, keinen Lesedurchsatz. Es braucht Tausende von Tokens, damit der Durchsatz zum bestimmenden Faktor wird, und genau darum geht es in Serie D.

#Generierung: sechs Modelle, eine Lesung

Balkendiagramm der Generationsgeschwindigkeit: Qwen 3.6 35B-A3B 167 Tokens pro Sekunde, gpt-oss 20B 113, gpt-oss 120B 79, Qwen 3.8 27B MLX 68, Gemma 4 12B 58, Qwen 3.8 27B GGUF 37
Generierung in Tokens pro Sekunde. Orange zeigt die MoE-Modelle, die pro Token nur 3 bis 5 Milliarden Parameter aktivieren; Blau zeigt die dichten Modelle.

Auf den ersten Blick wirkt diese Rangliste absurd: ein Modell mit 120 Milliarden Parametern, das 79 Tokens pro Sekunde generiert und damit doppelt so schnell ist wie ein 27B-Modell im GGUF-Format. Die Erklärung steckt in drei Buchstaben. gpt-oss 120B, gpt-oss 20B und Qwen 3.6 35B-A3B sind Mixture-of-Experts-Modelle, kurz MoE. Bei jedem Token wird nur ein Bruchteil der Parameter genutzt: etwa 5 Milliarden bei gpt-oss 120B, 3,6 Milliarden bei gpt-oss 20B und 3 Milliarden bei Qwen. Die Generierungsgeschwindigkeit hängt davon ab, was bei jedem Token im Speicher bewegt wird, nicht davon, was dort schläft.

Dichte Modelle wie Gemma 4 12B und Qwen 3.8 27B nutzen bei jedem Token alle ihre Parameter. Ihre Geschwindigkeit richtet sich daher nach der Speicherbandbreite geteilt durch die Modellgröße: Diese Regel gilt für Macs seit dem M1, und auch der M5 Max bildet keine Ausnahme. Auf dieser Maschine läuft ein dichtes 27B-Modell im GGUF-Format mit 37 Tokens pro Sekunde, ein 12B-Modell mit 58.

167 tok/s mit Qwen 3.6 35B-A3B unter MLX
Der höchste Wert der Messkampagne stammt von dem Modell, das beide Beschleuniger kombiniert: die MoE-Architektur und die MLX-Engine. Es bietet die Geschwindigkeit eines kleinen 8B-Modells mit dem Wissen eines 35B-Modells.
113 tok/s mit gpt-oss 20B
Das beste Verhältnis von Geschwindigkeit, Qualität und Speicherbedarf für den täglichen Einsatz als Assistent: 13 GB, eine Antwort mit 2.200 Tokens in 19 Sekunden.
79 tok/s mit gpt-oss 120B
Das leistungsfähigste Modell der Liste, mit der doppelten menschlichen Lesegeschwindigkeit. Dieses Ergebnis rechtfertigt die 128-GB-Stufe; darauf kommen wir weiter unten zurück.
58 und 37 Tok/s bei dichten Modellen
Gemma 4 12B und Qwen 3.8 27B im GGUF-Format: gut nutzbar, aber ohne Überraschungen. Die Werte liegen in denselben Größenordnungen wie auf einem M4 Max, da sich die Bandbreite zwischen den beiden Generationen kaum verändert hat.
i
Warum das dichte 27B-Modell langsamer ist als das 120B-MoE-Modell
Qwen 3.8 27B muss pro generiertem Token 17 GB an Modellgewichten übertragen. gpt-oss 120B überträgt etwa 3 GB, nämlich die Gewichte der aktivierten Experten, obwohl die gesamten 65 GB in den Speicher passen müssen. Bei 614 GB/s liegt die daraus resultierende Obergrenze für das erste Modell bei etwa 36 Tokens pro Sekunde, und genau das misst Joël. Das zweite Modell hat noch Spielraum.

#MLX gegen GGUF, unter gleichen Bedingungen

Vergleich zweier Balken: Qwen 3.8 27B mit 36,6 Tokens pro Sekunde im GGUF-Format und 68 Tokens pro Sekunde mit MLX, also 86 Prozent mehr
Dasselbe Modell, dieselbe Dateigröße bis auf ein Gigabyte, nur die Inferenz-Engine ändert sich. Der gemessene Unterschied beträgt 86 %.

Alle behaupten, dass MLX, Apples für Apple Silicon optimierte Bibliothek, schneller als llama.cpp ist. Nur sehr wenige messen das unter exakt gleichen Bedingungen, mit demselben Modell, am selben Tag und auf derselben Maschine. Genau das tut die Messreihe B: Qwen 3.8 27B in GGUF Q4 mit 36,6 Tokens pro Sekunde, dann Qwen 3.8 27B mit MLX bei 68,0 Tokens pro Sekunde. Ein Plus von 86 %.

Unser Leitfaden zu MLX und dem Mac M5 kündigte einen Leistungszuwachs von 30 bis 40 % bei der Generierung an. Auf dem M5 Max fällt der Zuwachs mit diesem Modell tatsächlich mehr als doppelt so groß aus. Ein Teil des Unterschieds ist vermutlich auf die MLX-Optimierungen speziell für die M5-Generation und die in die GPU integrierten neuronalen Beschleuniger zurückzuführen; ihren Beitrag können wir noch nicht isolieren. Was wir sagen können: Auf einem aktuellen Mac ein dichtes Modell im GGUF-Format auszuführen, obwohl es eine MLX-Version davon gibt, ist so, als ließe man die Hälfte der Maschine in der Garage stehen.

Ein Modell auf die MLX-Engine umstellen
ollama pull qwen3.8:27b-mlx
ollama run qwen3.8:27b-mlx --verbose
→
Eine Gewohnheit, die Sie sich aneignen sollten
Bevor Sie ein Modell herunterladen, prüfen Sie, ob es in der Ollama-Bibliothek einen -mlx-Tag gibt. Bei einem dichten Modell von 20 GB oder mehr ist der Unterschied mit bloßem Auge erkennbar. Der Leitfaden zu MLX und llama.cpp erklärt, wie die Engine ausgewählt wird und was zu tun ist, wenn ein MLX-Tag fehlt.

#Was 128 GB tatsächlich bieten

Schaubild: links der vereinheitlichte Speicher, ein gemeinsamer Speicherbereich von 128 GB für CPU und GPU, in den das 65 GB große KI-Modell passt; rechts der dedizierte Speicher, bei dem 65 GB nicht in 16 GB VRAM passen
Prinzipskizze. Der vereinheitlichte Speicher stellt der GPU den gesamten Speicherpool von 128 GB zur Verfügung. Auf einem Laptop kann eine Grafikkarte mit 16 GB kein 65 GB großes Modell laden, unabhängig davon, wie viel System-RAM vorhanden ist.

Bei der Speicherstufe von 128 GB geht es vor allem nicht um die Geschwindigkeit, sondern darum, welche Modelle hineinpassen. gpt-oss 120B belegt in MXFP4 65 GB. Kein PC-Notebook kann das Modell auf der GPU ausführen: Mobile Grafikkarten sind auf 16 oder 24 GB VRAM begrenzt. Auf dem M5 Max mit 128 GB lässt es sich laden, liefert in drei Durchläufen zwischen 75 und 79 Tokens pro Sekunde, und es bleibt noch Speicher frei.

Gestapelter Balken für die 128 GB: 35 GB für macOS und geöffnete Anwendungen, 65 GB für gpt-oss 120B, 28 GB frei
Speicherverteilung während der Messreihe C, in groben Größenordnungen. Joël hat nichts geschlossen: Obsidian, Terminal und die übrigen Anwendungen seiner Sitzung waren geöffnet.

Die vor der Testkampagne erfasste Speicherbelegung ist aussagekräftig: 35 GB waren durch macOS und die Anwendungen der laufenden Arbeitssitzung belegt, 93 GB standen für die KI zur Verfügung. Das 120B-Modell passt hinein und lässt rund dreißig Gigabyte Spielraum – genug für einen langen Kontext und ein zweites kleines Modell, das parallel läuft, etwa ein 8B-Modell für die Code-Autovervollständigung. Auf einem M5 Max mit 64 GB lässt sich dasselbe Modell überhaupt nicht laden; mit 96 GB passt es, aber ohne Spielraum für den Rest.

8,5 bis 22,7 Sekunden
Gesamtdauer der Antwort von gpt-oss 120B auf einen 300-Wort-Prompt bei drei Durchläufen: 669, 732 und anschließend 1.707 erzeugte Tokens. Die Geschwindigkeit bleibt konstant (79,1, 77,5 und 75,5 Tokens pro Sekunde), doch die Länge des Denkprozesses variiert von Durchlauf zu Durchlauf, je nachdem, ob das Modell seine Wörter einzeln zählt oder nicht.
50 Sekunden
Dauer der Serie D: Lesen eines Dokuments mit 16.689 Tokens und Erstellen einer Zusammenfassung in zehn Punkten mit 2.584 Tokens.
Thermische Belastung „Nominal“
Nach jeder Messreihe erfasst. Während der gesamten Messkampagne war kein Lüfter hörbar, auch nicht bei 120B.
i
Was wir auf dieser Stufe nicht messen konnten
Ein dichtes 70B-Modell in Q4, für dessen Konfiguration unsere Übersicht zum MacBook Pro M5 Max 15 bis 25 Tokens pro Sekunde mit MLX schätzt, war auf dem Gerät nicht installiert. Die Zahl bleibt bis zur nächsten Messkampagne eine Schätzung.

#Der Prefill, die Zahl, die niemand veröffentlicht

Zeitlicher Ablauf einer 50 Sekunden dauernden Anfrage: 12 Sekunden zum Einlesen eines Dokuments mit 16.689 Tokens bei 1.388 Tokens pro Sekunde, anschließend 38 Sekunden für die Antwort
Serie D. Das gesendete Dokument ist der Benchmarkbericht selbst, im Textformat exportiert, gefolgt von einer Anweisung zur Zusammenfassung.

Ein Prompt mit zwanzig Wörtern sagt nichts über das Prefill aus. Um es zu messen, schickte Joël gpt-oss 120B einen Text mit 11.280 Wörtern als einen einzigen Block, also 16.689 Tokens und etwa 45 Seiten, mit der Anweisung, eine Zusammenfassung zu erstellen. Ergebnis: 1.388 Tokens pro Sekunde beim Einlesen, also zwölf Sekunden, bis das erste Wort der Antwort erschien, anschließend eine Zusammenfassung mit 2.584 Tokens bei 67,6 Tokens pro Sekunde.

Diese Zahl ist für anspruchsvolle Anwendungen aussagekräftig. Einen Vertrag analysieren, einen Auditbericht zusammenfassen, eine Dokumentenbasis per RAG abfragen: In all diesen Fällen verbringt das Modell den größten Teil seiner Zeit mit Lesen, nicht mit Schreiben. Zwölf Sekunden für 45 Seiten auf einem Laptop, ohne dass ein einziges Byte die Maschine verlässt – das macht lokale KI für einen Berater mit beruflicher Schweigepflicht oder ein Unternehmen mit Vertraulichkeitsanforderungen nutzbar.

→
Größenordnung für Ihre Dokumente
Bei einer Lesegeschwindigkeit von 1.388 Tokens pro Sekunde wird ein Vertrag mit 30 Seiten in 8 Sekunden und ein Bericht mit 100 Seiten in 27 Sekunden gelesen. Diese Zeiten kommen zur Zeit für die Generierung der Antwort hinzu; planen Sie daher auf diesem Rechner etwa eine Minute für eine vollständige Zusammenfassung eines langen Dokuments ein.

#Wärme und Lüfter

Joël hat den thermischen Zustand nach jeder Serie mit dem macOS-Befehl zur Ermittlung des thermischen Drucks dokumentiert. Das Ergebnis war stets „Nominal“, und es waren keine Lüftergeräusche hörbar, auch nicht während der Serie D, die die GPU fünfzig Sekunden lang voll auslastet. Das stimmt mit den Beobachtungen bei den M4 Max überein, allerdings mit einer Einschränkung: Unsere Messungen bestehen aus kurzen Belastungsphasen von weniger als einer Minute. Der im Protokoll vorgesehene Throttling-Test – zehn Minuten Dauerlast und anschließend eine erneute Messung der Serie A – wurde nicht durchgeführt. Wir werden bei der nächsten Messkampagne darum bitten.

Die thermische Belastung während einer Generierung prüfen
sudo powermetrics --samplers thermal -i 1000 -n 1 | grep -i pressure

#Was diese Messungen nicht aussagen

Ein ehrlicher Benchmark listet auch das, was er nicht beweist. Hier sind die Einschränkungen in Reihenfolge der Bedeutung.

Prefill bei kurzen Prompts
Zwei Durchläufe pro Modell, der zweite wird für die Auswertung verwendet. Mit Prompts von 43 bis 98 Tokens wird jedoch nur die Startlatenz gemessen: Nur die Serie D mit 16.689 Tokens liefert einen echten Lesedurchsatz.
Kein dichtes Modell mit 70 Milliarden Parametern
Die Speicherstufe mit 128 GB ist auch für 70B-Modelle in Q4 mit langem Kontext gerechtfertigt. Hier nicht gemessen.
Kein Test auf Throttling
Kurze Lastphasen von weniger als einer Minute. Das Verhalten bei einer Stunde intensiver RAG-Nutzung muss noch dokumentiert werden.
Keine Messung im Akkubetrieb
Das Protokoll schreibt Netzbetrieb vor. Rechnen Sie im Akkubetrieb mit deutlich niedrigeren Werten, da macOS den Chip drosselt.
Ein individuelles Dokument für die Testreihe D je Tester
Der lange Text, der in Serie D übermittelt wird, ist vom Protokoll nicht vorgegeben: Zwei Tester lesen nicht dasselbe Dokument, was die Vergleichbarkeit der Prefill-Messungen zwischen verschiedenen Maschinen einschränkt. Auf Vorschlag von Joël stellt das Protokoll nun einen einheitlichen Referenztext mit 11.292 Wörtern bereit, der im folgenden Abschnitt heruntergeladen werden kann: Die nächsten Messungen werden untereinander vergleichbar sein. Die Messung auf dieser Seite wurde zuvor mit einem anderen Dokument vergleichbarer Größe durchgeführt.
Ein einziger Rechner, ein einziger Bediener
Keine Varianz gemessen. Wenn Sie dieselbe Konfiguration verwenden, sind Ihre Messwerte willkommen; siehe den folgenden Abschnitt.
Modelle im Reasoning-Modus
Modelle, die vor der Antwort nachdenken, erzeugen deutlich mehr Tokens als die 300 geforderten Wörter, und diese Länge variiert von einer Ausführung zur nächsten für das gleiche Modell (669 bis 1.707 Tokens auf gpt-oss 120B). Die Gesamtlaufzeiten sind daher nicht vergleichbar, nur die Geschwindigkeiten sind das.
Prompt-Cache bei Wiederholungen
Wenn der gleiche Prompt erneut gestartet wird, verwendet Ollama die bereits gelesenen Tokens („prompt eval cached“). Der Pre-fill bei einer identischen Wiederholung ist daher keine Messung; um den Pre-fill zu messen, benötigt man einen langen, neuen Prompt, wie bei Serie D.

#Den Benchmark bei sich zu Hause reproduzieren

Laptop von oben auf einem weißen Schreibtisch, mechanische Stoppuhr, angeschlossenes Ladegerät, Notizbuch und Stift
Illustration. Netzteil angeschlossen, Anwendungen geschlossen, jeweils nur ein Modell: drei Bedingungen, ohne die eine Messung nichts wert ist.

Das Protokoll ist so konzipiert, dass es auf jedem Mac mit Apple Silicon, vom MacBook Air bis zum Mac Studio, unverändert wiederholt werden kann. Wenn Sie dieselben Testreihen mit demselben Prompt durchführen, sind Ihre Zahlen direkt mit denen auf dieser Seite vergleichbar.

  1. 01
    Die Maschine vorbereiten
    Schließen Sie das Gerät an die Stromversorgung an und schließen Sie den Browser, Docker und die virtuellen Maschinen. Notieren Sie Ihr Chipmodell, die Anzahl der GPU-Kerne und die Ollama-Version.
  2. 02
    Den Systemzustand erfassen
    Notieren Sie den Chip, die Anzahl der GPU-Kerne, die Versionen von macOS und Ollama, die Stromversorgung, den verfügbaren Speicher und die geöffneten Anwendungen. Joël hat ein zsh-Skript geschrieben, das diesen Bericht mit einem einzigen Befehl erstellt; es wird nach Überprüfung mit seiner Zustimmung in das Benchmark-Kapitel des Mac-Kits aufgenommen.
  3. 03
    Serie A
    Laden Sie gemma4:12b und qwen3.8:27b herunter, starten Sie jedes Modell mit --verbose, fügen Sie den gemeinsamen Prompt ein, lassen Sie die Antwort vollständig generieren und beenden Sie mit /bye. Führen Sie zwei Durchläufe durch und behalten Sie den zweiten.
  4. 04
    Serie B
    Dasselbe mit qwen3.8:27b-mlx durchführen. Vergleichen Sie die Zeile eval rate mit der entsprechenden Zeile aus Serie A.
  5. 05
    Serie C
    Wenn Sie 96 GB oder mehr haben: gpt-oss:120b. Andernfalls wählen Sie das größte Modell, das in Ihren vereinheitlichten Speicher abzüglich 10 GB passt.
  6. 06
    Serie D
    Laden Sie den QuelLLM-Referenztext mit 11.292 Wörtern herunter, der für alle identisch ist, und übergeben Sie ihn an ollama run, gefolgt von der Anweisung „Fasse diesen Text in 10 Stichpunkten zusammen“. Notieren Sie die angezeigte Anzahl der Prompt-Tokens: Sie hängt vom Modell ab, nicht vom Text.
Befehle des Protokolls
# Série A — les deux repères
ollama pull gemma4:12b && ollama pull qwen3.8:27b
ollama run gemma4:12b --verbose
ollama run qwen3.8:27b --verbose

# Série B — même modèle, moteur MLX
ollama pull qwen3.8:27b-mlx
ollama run qwen3.8:27b-mlx --verbose

# Série C — le palier 128 Go (65 Go à télécharger)
ollama pull gpt-oss:120b
ollama run gpt-oss:120b --verbose

# Série D — préfill sur le texte de référence commun (11 292 mots)
curl -sO https://quelllm.fr/img/protocole/texte-reference-quelllm-v1.txt
ollama run gpt-oss:120b --verbose "$(cat texte-reference-quelllm-v1.txt) Résume ce texte en 10 puces."
→
Schicken Sie uns Ihre Messprotokolle
Fügen Sie den unverarbeiteten Statistikblock jeder Messung in eine E-Mail an contact@quelllm.fr ein und geben Sie Ihren Chip, Ihre GPU-Kerne und Ihre Ollama-Version an. Wir veröffentlichen die überprüften Messwerte mit Ihrem Namen oder anonym, wenn Sie das bevorzugen. Folgende Konfigurationen fehlen uns besonders: M5 Max 64 GB, M5 Pro, Mac Studio M5 Ultra.

#Für wen und zu welchem Preis

Der M5 Max mit 128 GB rechtfertigt sich durch einen einzigen Einsatzzweck: Modelle lokal auszuführen, die in keinen anderen Laptop passen, mit Spielraum für den Kontext und ein zweites Modell. gpt-oss 120B mit 79 Tokens pro Sekunde und ein 45-seitiges Dokument, das in zwölf Sekunden gelesen wird, ohne Lüfter – das ist eine KI-Workstation, die in eine Tasche passt.

Einordnung der Ergebnisse nach Nutzungsprofil
Sie sindWas dieser Benchmark Ihnen sagtEmpfohlene Stufe
Berater, Anwalt oder Steuerberater mit beruflicher SchweigepflichtEin 120B-Modell liest Ihre Unterlagen lokal und fasst sie mit einer praxistauglichen Geschwindigkeit zusammen, ohne etwas nach außen zu sendenM5 Max 128 GB
Entwickler, der einen leistungsfähigen lokalen Copiloten möchtegpt-oss 20B oder Qwen 3.6 35B-A3B reichen vollkommen aus und passen in 48 GB. Unsere Werte von 113 und 167 tok/s gelten für den Chip mit 40 GPU-Kernen: Der Speicher reicht aus, auf einer Variante mit geringerer Bandbreite wird die Geschwindigkeit niedriger seinM5 Max 48 oder 64 GB
Täglicher Nutzer eines SchreibassistentenEin dichtes 12B-Modell oder ein 20B-MoE-Modell decken diesen Einsatz ab; 128 GB sind Luxus. Der Speicher reicht aus, aber der des M5 Pro ist langsamer: Rechnen Sie mit weniger als unseren 58 und 113 tok/sM5 Pro 48 GB
Team, das einen gemeinsam genutzten Server möchteDer Mac Studio M5 Max oder Ultra bietet dieselbe technische Basis mit mehr Speicher und einer Kühlung für Desktop-RechnerMac Studio
!
Diese Geschwindigkeiten gelten für diese Chipvariante
Alle Zahlen auf dieser Seite wurden auf einem M5 Max mit 40 GPU-Kernen und 614 GB/s Speicherbandbreite gemessen. Die Textgenerierung mit einem LLM wird durch diese Bandbreite begrenzt: Auf einem M5 Max mit 32 GPU-Kernen oder einem M5 Pro, deren Speicher langsamer ist, passen dieselben Modelle in den Speicher, laufen aber langsamer. Die obige Tabelle zeigt, was in den Speicher passt, nicht die Geschwindigkeit, die Sie mit einer anderen Ausstattungsvariante erreichen.

Wenn Sie höchstens Modelle mit 30 Milliarden Parametern benötigen, reicht die Hälfte des Speichers aus, und vom Preisunterschied lässt sich ein sehr guter Monitor finanzieren. Wenn Ihr Bedarf erst bei Modellen mit 100 Milliarden Parametern beginnt, gibt es keine tragbare Alternative. Dieser Leitfaden liefert Ihnen die Zahlen, um diese Wahl gegenüber der Person zu begründen, die die Bestellung unterschreibt.

#Quellen und Credits

Berater bei nächtlicher Arbeit an einem Laptop mit einem Terminal auf dem Bildschirm, daneben eine Schreibtischlampe und ein Notizbuch
Illustration. Ein typischer Arbeitsablauf, offene Anwendungen: Unter diesen Bedingungen wurden die Messungen durchgeführt, auf der Arbeitsmaschine des Autors.

Die Messungen auf dieser Seite wurden von Joël Ramat durchgeführt. Er ist Berater für Cybersicherheit und GRC, ISO-27001-Experte, bietet durch On-Premise-KI unterstützte Beratung und Audits an und ist Mitgründer und Präsident von Sywédgia SAS. Er hat das QuelLLM-Protokoll am 16. September 2026 auf seinem eigenen Rechner ausgeführt und diesen Artikel vor der Veröffentlichung gegengelesen. Die Messdaten bleiben seine eigenen, und es steht ihm frei, sie selbst zu veröffentlichen.

Methode: Rohausgaben von ollama run --verbose nach jeder Messung unverändert kopiert; Systemzustand vor der Messkampagne per Skript erfasst; thermische Belastung nach jeder Messreihe ausgelesen. Der vollständige Bericht mit den ungekürzten Antworten der Modelle wird aufbewahrt und kann auf Anfrage bereitgestellt werden. Redaktion und Formatierung: Mohamed Meguedmi, WelchesLLM.


#FAQ

Ist der M5 Max 128 GB schneller als der M4 Max 128 GB bei lokaler KI?+
Bei dichten Modellen im GGUF-Format nicht wesentlich schneller: Die Speicherbandbreite hat sich kaum verändert, und Qwen 3.8 27B läuft mit 37 Tokens pro Sekunde, also in einer mit dem M4 Max vergleichbaren Größenordnung. Mit MLX wird der Abstand größer: Dort erreicht der M5 Max beim selben Modell gemessene 68 Tokens pro Sekunde. Uns liegt keine Messung des M4 Max mit MLX unter denselben Bedingungen vor, mit der sich der genaue Abstand beziffern ließe.
Warum ist gpt-oss 120B schneller als Qwen 3.8 27B?+
Weil gpt-oss 120B ein MoE-Modell ist, das pro Token nur etwa 5 Milliarden Parameter aktiviert, während das dichte Modell Qwen 3.8 27B bei jedem Token 27 Milliarden Parameter bewegt. Die Geschwindigkeit hängt von den aktiven Parametern ab, nicht von der Gesamtzahl der Parameter. Allerdings müssen die 65 GB des 120B in den Arbeitsspeicher passen, was nur mit einer Ausstattung von 96 oder 128 GB möglich ist.
Braucht man 128 GB, um gpt-oss 120B zu betreiben?+
Mindestens 96 GB vereinheitlichter Speicher sind erforderlich, um das Modell mit einem angemessenen Kontext zu laden. 128 GB bieten Spielraum für einen langen Kontext, ein zweites leichtes Modell und eine normale, parallel geöffnete Arbeitsumgebung. Joël ließ das 120B-Modell laufen, während seine Anwendungen bereits 35 GB belegten.
Gilt das auch bei Akkubetrieb?+
Nein. Das Protokoll schreibt Netzbetrieb vor, weil macOS den Chip im Akkubetrieb drosselt. Rechnen Sie unterwegs mit deutlich niedrigeren Geschwindigkeiten und vor allem mit nicht reproduzierbaren Messungen.
Warum werden die Prefills der Serien A, B und C nicht veröffentlicht?+
Sie wurden an Prompts mit 43 bis 98 Tokens gemessen. Bei dieser Größe dauert der Pre-fill weniger als eine Sekunde und spiegelt eine Startlatenz, nicht einen Lesedurchsatz wider; die Zahl sagt nichts über die Lesegeschwindigkeit eines echten Dokuments aus. Der einzige nutzbare Pre-fill stammt aus der Serie D mit 16.689 Tokens: 1.388 Tokens pro Sekunde.
Kann ich meine eigenen Messungen senden?+
Ja. Führen Sie die Serien A bis D mit dem gemeinsamen Prompt und zwei Durchläufen pro Messung durch und senden Sie die unverarbeiteten Statistikblöcke zusammen mit Ihrer Konfiguration an contact@quelllm.fr. Wir veröffentlichen die überprüften Messdaten und nennen Sie dabei als Urheber.
Wo findet man das für diesen Benchmark verwendete Vorbereitungsskript?+
Das von Joël Ramat geschriebene zsh-Skript, das vor der Messung einen vollständigen Bericht über den Zustand des Macs erstellt, wird nach der Überprüfung auf anderen Rechnern mit seiner Erlaubnis und unter Nennung seines Namens in das Benchmark-Kapitel des Mac-Kits aufgenommen. Bis dahin listet der Abschnitt „Den Benchmark reproduzieren“ die Informationen auf, die man von Hand erfassen muss.

Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.