Mac Studio M5 Max / M5 Ultra: Test und Bewertung für lokale KI
Der erste Rechner für den Massenmarkt, der ein Frontier-Modell lokal ausführt. Wir betrachten, worauf es beim Betrieb von LLMs ankommt lokal : Speicher, Bandbreite, Geschwindigkeit, Preis – und für wen sich der Kauf lohnt und für wen nicht.
Aktualisiert am 05.10.2026
Wo kaufen
Die über den Button angebotene Konfiguration entspricht der beim Kauf angebotenen. Halten Sie bei Mini-PCs Speicher für das System frei und prüfen Sie die Inferenz-Engine; macOS/MLX und CUDA sind nicht austauschbar.
Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass dies für Sie zusätzliche Kosten verursacht. Dies beeinflusst diese Empfehlungen (die unabhängig erstellt wurden) nicht. Als Amazon-Partner erzielt QuelLLM Einnahmen aus qualifizierten Käufen.
Technische Daten
- SpeicherM5 Max: 36 bis 128 GB · M5 Ultra: 96 bis 512 GB gemeinsamer Speicher (die 512-GB-Ausführung kommt Ende Oktober)
- BandbreiteM5 Max: 460 GB/s (GPU mit 32 Kernen) / 614 GB/s (GPU mit 40 Kernen) · M5 Ultra: bis zu 1,2 TB/s (+50 % gegenüber der vorherigen Generation)
- BerechnungM5 Max: CPU mit 18 Kernen, GPU mit bis zu 40 Kernen · M5 Ultra: CPU mit 36 Kernen, GPU mit 80 Kernen, Neural Engine mit 32 Kernen — Neural Accelerators in jedem GPU-Kern, Thunderbolt 5, PCIe-Gen-6-SSD
- VerbrauchDesktop-Rechner, leise Kühlung
- Richtpreis2.999 € (M5 Max 36 GB / 512 GB) · 6.599 € (M5 Ultra 96 GB / 1 TB) — bis zu ≈ 20.000 € bei 512 GB / 16 TB
- Größtes Modell36 GB: 30B-Klasse · 64–96 GB: 70B in Q4 · 128 GB: GPT-OSS-120B problemlos · 256 GB: Qwen3-235B (MoE) · 512 GB: Frontier-MoE mit ~600B in Q4, DeepSeek-Klasse — siehe Tabelle der Speicherstufen
Für wen?
Vorteile und Grenzen
✓ Stärken
- 512 GB Unified Memory mit 1,2 TB/s: Ein Modell mit ~600 Milliarden Parametern (Q4) passt VOLLSTÄNDIG in den lokalen Speicher – außerhalb von Servern bislang beispiellos
- Apple kündigt eine bis zu 4,3-fache KI-Leistung gegenüber der vorherigen Generation an (Neural Accelerators pro GPU-Kern)
- macOS + MLX: das am besten optimierte Ökosystem für lokale LLMs auf Apple-Systemen (LM Studio, Ollama, mlx-lm)
- Leise, kompakt, geringer Stromverbrauch gemessen an der Kapazität – kein Multi-GPU-Tower bietet Platz für 512 GB VRAM
- Thunderbolt 5 und PCIe-Gen-6-SSDs: deutlich schnelleres Laden der Modellgewichte
✗ Einschränkungen
- Die 512-GB-Variante wird erst Ende Oktober 2026 versendet (der Rest ab dem 22.09.)
- Apple-Preis: Die Konfiguration mit 512 GB kostet deutlich mehr als 10.000 € – anspruchsvollen professionellen Anwendungen vorbehalten
- Unter 96 GB bietet ein kleiner PC Strix Halo 128 GB (≈ 3 300 bis 4 000 €) mehr Speicher pro Euro
- Kein CUDA: Aufwendiges Fine-Tuning und bestimmte Tools sind mit NVIDIA weiterhin einfacher zu nutzen
Welche Speicherausstattung für welche Modelle?
Die Regel: die Speicher bestimmt die Größe des Modells, das geladen werden kann, die Bandbreite bestimmt die Generierungsgeschwindigkeit. Die Geschwindigkeitsangaben sind Richtwerte für die Textgenerierung (Dekodierung) mit Q4-Quantisierung über MLX / llama.cpp — MoE-Modelle nutzen nur ihre aktiven Parameter, daher ihre hohen Durchsatzraten.
| Konfiguration | Bandbreite | Was läuft (Q4) | Geschätzte Geschwindigkeit |
|---|---|---|---|
| M5 Max 36 GB | 460 GB/s | Klasse 30B: Qwen3-32B, GLM-4.7-Flash | ~25-35 Tok/s |
| M5 Max 64 GB | 614 GB/s (GPU mit 40 Kernen) | 70B in Q4 (~40 GB); MoE 30B-A3B sehr schnell | ~13-16 tok/s (70B) · 80+ tok/s (MoE A3B) |
| M5 Max 128 GB | 614 GB/s | 70B in Q8, GPT-OSS-120B (MXFP4), langer Kontext | ~40-60 Tok/s (GPT-OSS-120B) |
| M5 Ultra 96 GB | 1,2 TB/s | 70B in Q4 mit Spielraum für den Kontext | ~25-30 tok/s |
| M5 Ultra 256 GB | 1,2 TB/s | Qwen3-235B-A22B in Q4 (~135 GB) | ~25-35 Tok/s |
| M5 Ultra 512 GB | 1,2 TB/s | MoE-Spitzenmodelle mit ~600B in Q4 (DeepSeek-Klasse, ~380–400 GB) | ~15-20 tok/s |
Das Prefill (Lesen des Prompts) profitiert zusätzlich von den Neural Accelerators der M5-GPU — bei langen Kontexten war dies historisch die Schwachstelle von Macs gegenüber NVIDIA-GPUs.
M5 Max oder M5 Ultra?
Le M5 Max (2.999 € mit 36 GB, BTO bis zu 128 GB) deckt alle Modelle bis 70B sowie MoE-Modelle mit rund 120B ab: Er ist die rationale Wahl für anspruchsvolle Entwicklungs-, Copilot- und RAG-Anwendungen. Wählen Sie unbedingt die GPU mit 40 Kernen sobald Sie 36 GB überschreiten: Die Bandbreite steigt von 460 auf 614 GB/s, was für jedes Token ein Drittel mehr Geschwindigkeit bedeutet.
Le M5 Ultra (6.599 € mit 96 GB) lohnt sich nur wegen seines Speichers: Mit 96 GB schneidet er kaum besser ab als ein günstigerer M5 Max mit 128 GB. Sein eigentlicher Daseinsgrund sind die Speicherstufen 256 und 512 GB — die einzigen, die den Einsatz von MoE-Modellen mit 235 bis etwa 600 Milliarden Parametern ermöglichen. Wenn Sie keinen konkreten Anwendungsfall für diese Modelle haben, ist der Ultra ein schlechter Kauf; wenn Sie einen haben, ist er die einzige Desktop-Hardware, die das ermöglicht.
Im Vergleich zu Alternativen
| Rechner | Speicher | Bandbreite | Preis | Die richtige Nutzung |
|---|---|---|---|---|
| Mac Studio M5 Max | 36-128 GB | 460–614 GB/s | ab 2.999 € | Schneller Betrieb von 70B-Modellen und MoE-Modellen mit ~120B Parametern, MLX-Ökosystem |
| Mac Studio M5 Ultra | 96–512 GB | 1,2 TB/s | ab 6.599 € | MoE 235–600B: ohne Pendant im Desktop-Bereich |
| Mini-PC Strix Halo | 64-128 GB | 212 GB/s | ≈ 2 000-4 000 € | Das beste Verhältnis von Speicherkapazität zu Preis (70B langsam, aber zugänglich) |
| NVIDIA DGX Spark | 128 GB | 273 GB/s | ≈ 6 100 – 6 600 € | CUDA-Ökosystem erforderlich, Fine-Tuning |
| RTX 5090 | 32 GB | 1,79 TB/s | ≈ 5 700 € | Reine Geschwindigkeit bis zu ~32B, nicht darüber hinaus |
Zusammengefasst: reine Geschwindigkeit bei kleinen Modellen → dedizierte GPU; maximale Kapazität pro Euro → Strix Halo; maximale Kapazität insgesamt → M5 Ultra.
Verfügbarkeit: Was man wissen muss
- Verfügbar seit dem 22. September 2026 (Vorbestellungen ab 25. August verfügbar).
- Die Variante mit 512 GB wird erst Ende Oktober versandt — bestellen Sie früh, wenn dies Ihr Ziel ist.
- Bei französischen Händlern: M5 Max 36 GB / 512 GB bei Darty und M5 Max 96 GB / 512 GB bei Materiel.net; die anderen Speicherkonfigurationen sind über den BTO-Konfigurator des Apple Store erhältlich.
- Der Mac Studio M4 Max 36 GB / 512 GB ist bei unseren Händlern nicht mehr als Neuware auf Lager (Ende September 2026 überprüft) — unsere Übersicht zum M4 Max zum Vergleich.
Fazit
Häufige Fragen
Kann der Mac Studio M5 Max / M5 Ultra ein 70B-LLM lokal ausführen?
36 GB: 30B-Klasse · 64–96 GB: 70B in Q4 · 128 GB: GPT-OSS-120B problemlos · 256 GB: Qwen3-235B (MoE) · 512 GB: Frontier-MoE mit etwa 600B Parametern in Q4, DeepSeek-Klasse – siehe Tabelle der Speicherstufen.
Wie viel kostet der Mac Studio M5 Max / M5 Ultra?
2.999 € (M5 Max 36 GB / 512 GB) · 6.599 € (M5 Ultra 96 GB / 1 TB) — bis zu ≈ 20.000 € bei 512 GB / 16 TB (ab 2.499 $ (M5 Max) · 5.499 $ (M5 Ultra)). Die Preise ändern sich schnell — prüfen Sie den aktuellen Preis über die Kauflinks.
Für wen ist der Mac Studio M5 Max / M5 Ultra geeignet?
Entwickler und Kreative unter macOS, die große LLMs an einem stationären Arbeitsplatz nutzen möchten – von der 30B-Klasse (36 GB) bis zu MoE-Spitzenmodellen mit etwa 600B in Q4 (512 GB).
Kann ein Modell der Klasse DeepSeek lokal auf dem Mac Studio M5 ausgeführt werden?
Ja, das ist DIE Neuerung: In 512 GB gemeinsamem Arbeitsspeicher findet ein in Q4 quantisiertes MoE-Modell auf Spitzenniveau mit rund 600 Milliarden Parametern (~380–400 GB Modellgewichte) vollständig Platz. Dank der MoE-Architektur wird die Generierungsgeschwindigkeit auf 15–20 tok/s geschätzt (bei jedem Token werden nur die aktiven Parameter gelesen). Siehe auch unser Leitfaden zu DeepSeek V4 Flash.
Kann man noch den Mac Studio M4 Max statt des M5 wählen?
Nicht mehr als Neuware bei unseren Händlern erhältlich: der M4 Max 36 GB / 512 GB, im Sommer im Abverkauf für 2.219 € angeboten, ist Ende September 2026 nicht mehr auf Lager. Der M5 Max übernimmt für 2.999 €: höhere Bandbreite, Neural Accelerators und Speicherkonfigurationen bis zu 128 GB, die der M4 Max nicht mehr bietet.
Warum ist vereinheitlichter Speicher bei großen Modellen einer GPU überlegen?
Eine dedizierte GPU ist auf 32 GB VRAM begrenzt (RTX 5090): Darüber hinaus muss ein Teil des Modells über den PCIe-Bus in den Arbeitsspeicher ausgelagert werden, und die Geschwindigkeit bricht ein. Apples gemeinsamer Speicher ermöglicht der GPU direkten Zugriff auf die gesamten 96–512 GB: Das gesamte Modell bleibt mit voller Bandbreite zugänglich. Das ist bei gleicher Kapazität langsamer als GDDR7-VRAM, aber es ist die einzige Desktop-Lösung, in der riesige Modelle Platz finden.