Startseite › Katalog › Bestes LLM auf dem Mac mit 128 GB Unified Memory im Jahr 2026

Bestes LLM auf dem Mac mit 128 GB Unified Memory im Jahr 2026

◆ Mac — Lokale KI auf Ihrem Mac, voll ausgereizt — Unified Memory, MLX, das richtige Modell für Ihren Chip · 24 € · oder alle Kits für 49 € →

Ranking aktualisiert am 22.09.2026

128 GB vereinheitlichter Speicher entsprechen der Premium-Stufe einer KI-Workstation – und diese ist nicht mehr auf Desktop-Rechner beschränkt: Das MacBook Pro mit 14 oder 16 Zoll erreicht sie sowohl mit M5 Max als auch mit M4 Max, sofern Sie die GPU-Variante mit 40 Kernen wählen (614 GB/s beim M5 Max gegenüber 460 GB/s bei der Variante mit 32 Kernen). Llama 70B in Q8 (~75 GB), MoE 150B in Q4, 200k Kontext für RAG im Unternehmen.

Angebote und Alternativen für lokale KI

Vergleichen Sie die Preise für MacBook Pro M5 Pro — 24 GB / 1 TB bei unseren Partnerhändlern (verifizierte Produktseiten):

Welchen PC sollten Sie je nach Budget wählen? Unsere Auswahl von 800 bis 3 500 € →

Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass Ihnen Mehrkosten entstehen. Dies beeinflusst die unabhängig erstellte Rangliste nicht. Als Amazon-Partner verdient QuelLLM an qualifizierten Käufen.

Rangliste

1

🇺🇸 Laguna XS.2

Poolside · 33 Milliarden Parameter · Apache 2.0 · Kontext: 131 072 Tokens

MoE mit 33B/3B aktiven Parametern unter Apache 2.0, Spezialist für agentisches Programmieren. 68,2 % SWE-Bench Verified, 128k ctx. Läuft auf einem Mac mit 36 GB. Veröffentlichung am 28. April 2026.

Warum dieser Rang MoE mit 33B/3B aktiven Parametern unter Apache 2.0, Spezialist für agentisches Programmieren. 68,2 % SWE-Bench Verified, 128k ctx. Läuft auf einem Mac mit 36 GB. Veröffentlichung am 28. April 2026.
ollama run laguna-xs.2
Auf Apple M5 Max (128 GB)
FP16
66 GB · 100 Tok/s
2

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31B Parameter · MIT · Kontext: 128 000 Tokens

GLM-4.7-Flash (MoE mit 31B Parametern, davon ~3B aktiv): das beste Verhältnis von Code-Leistung zu VRAM-Bedarf in der 30B-Klasse. MIT, 128k ctx, sehr schnell auf 3090/4090.

Warum dieser Rang GLM-4.7-Flash (MoE mit 31B Parametern, davon ~3B aktiv): das beste Verhältnis von Code-Leistung zu VRAM-Bedarf in der 30B-Klasse. MIT, 128k ctx, sehr schnell auf 3090/4090.
ollama run glm-4.7-flash
Auf Apple M5 Max (128 GB)
FP16
62 GB · 100 Tok/s
3

🇺🇸 Granite 4.0 H-Small 32B-A9B

IBM · 32 Milliarden Parameter · Apache 2.0 · Kontext: 128 000 Tokens

Hybrid aus Mamba-2 und MoE mit 32B Parametern, davon 9B aktiv. ~70 % weniger RAM bei langem Kontext. Apache 2.0.

Warum dieser Rang Hybrid aus Mamba-2 und MoE mit 32B Parametern, davon 9B aktiv. ~70 % weniger RAM bei langem Kontext. Apache 2.0.
ollama run granite4:small-h
Auf Apple M5 Max (128 GB)
FP16
64 GB · 75 tok/s
4

🇨🇳 Qwen 3.6 35B-A3B

Alibaba · 35 Milliarden Parameter · Apache 2.0 · Kontextfenster: 262 000 Tokens

MoE mit 35B Parametern, davon 3B aktiv, für agentisches Coding. 73,4 % SWE-Bench. Veröffentlicht am 16. April 2026.

Warum dieser Rang MoE mit 35B Parametern, davon 3B aktiv, für agentisches Coding. 73,4 % SWE-Bench. Veröffentlicht am 16. April 2026.
ollama run qwen3.6:35b-a3b
Auf Apple M5 Max (128 GB)
FP16
70 GB · 60 Tok/s
5

🇨🇳 Qwen 3 30B-A3B

Alibaba · 30B Parameter · Apache 2.0 · Kontext: 131 072 Tokens

MoE mit 30B Parametern, davon 3B aktiv, und Hybrid-Thinking. MMLU 81,4, AIME24 80,4. 100+ Sprachen.

Warum dieser Rang MoE mit 30B Parametern, davon 3B aktiv, und Hybrid-Thinking. MMLU 81,4, AIME24 80,4. 100+ Sprachen.
ollama run qwen3:30b-a3b
Auf Apple M5 Max (128 GB)
FP16
62 GB · 100 Tok/s
6

🇺🇸 Nemotron Cascade 2 30B-A3B

NVIDIA · 30B Parameter · NVIDIA Open Model License · Kontext: 128 000 Tokens

MoE mit 30B/3B aktiven Parametern: Thinking-Modus + Instruct. Goldmedaille bei der IMO 2025 und der IOI 2025. Schnelle Inferenz dank 3B aktiver Parameter, Reasoning-Fähigkeiten auf 30B-Niveau. Veröffentlichung im April 2026.

Warum dieser Rang MoE mit 30B/3B aktiven Parametern: Thinking-Modus + Instruct. Goldmedaille bei der IMO 2025 und der IOI 2025. Schnelle Inferenz dank 3B aktiver Parameter, Reasoning-Fähigkeiten auf 30B-Niveau. Veröffentlichung im April 2026.
ollama run nemotron-cascade-2
Auf Apple M5 Max (128 GB)
FP16
60 GB · 80 tok/s
7

🇨🇳 Qwen3-Coder 30B-A3B

Alibaba · 30B Parameter · Apache 2.0 · 262 144 tokens ctx

MoE 30B (3,3B aktive Parameter), spezialisiert auf agentisches Coding. Sehr schnell lokal, 256k nativer Kontext, die Referenz für 16–24 GB via Ollama.

Warum dieser Rang MoE 30B (3,3B aktive Parameter), spezialisiert auf agentisches Coding. Sehr schnell lokal, 256k nativer Kontext, die Referenz für 16–24 GB via Ollama.
ollama run qwen3-coder:30b
Auf Apple M5 Max (128 GB)
FP16
61 GB · 100 Tok/s
8

🇨🇳 Qwen 3 VL 30B-A3B

Alibaba · 30B Parameter · Apache 2.0 · 262 144 tokens ctx

Vision-MoE mit 30B Parametern, davon 3B aktiv. Sweet Spot für Vision mit Qwen 3. 256k ctx.

Warum dieser Rang Vision-MoE mit 30B Parametern, davon 3B aktiv. Sweet Spot für Vision mit Qwen 3. 256k ctx.
ollama run qwen3-vl:30b
Auf Apple M5 Max (128 GB)
FP16
62 GB · 100 Tok/s

Vergleichstabelle

Rang Modell Params VRAM Q4 Kontext Lizenz Auf Apple M5 Max (128 GB)
#1 Laguna XS.2 33B 19 GB 131 072 Apache 2.0 100 Tok/s · FP16
#2 GLM 4.7 Flash 31B 19 GB 128 000 MIT 100 Tok/s · FP16
#3 Granite 4.0 H-Small 32B-A9B 32B 19 GB 128 000 Apache 2.0 75 Tok/s · FP16
#4 Qwen 3.6 35B-A3B 35B 21 GB 262 000 Apache 2.0 60 tok/s · FP16
#5 Qwen 3 30B-A3B 30B 19 GB 131 072 Apache 2.0 100 Tok/s · FP16
#6 Nemotron Cascade 2 30B-A3B 30B 17 GB 128 000 NVIDIA Open Model License 80 Tok/s · FP16
#7 Qwen3-Coder 30B-A3B 30B 19 GB 262 144 Apache 2.0 100 Tok/s · FP16
#8 Qwen 3 VL 30B-A3B 30B 19 GB 262 144 Apache 2.0 100 Tok/s · FP16
Das Mac-Kit

Lokale KI auf Ihrem Mac voll ausschöpfen: Unified Memory, MLX vs. GGUF, das passende Modell für Ihren Chip und auf Apple Silicon abgestimmte Einstellungen für Ollama und LM Studio.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Kostenloses Memo

Welches Code-Modell lässt sich auf IHREM Rechner ausführen?

Memo erhalten VRAM → bestes Code-Modell → Ollama-Befehl (alles auf einem Bildschirm, zum Kopieren und Einfügen). Und wechseln Sie zum Kit Copilote Local, um daraus ein wirklich funktionierendes Setup zu machen.

Das Kit „Copilote Local“ — die Ollama- + Cline- + Aider-Configs zum direkten Einfügen, angepasste Modelfiles, Hilfe bei Problemen, lebenslanger Zugang zum Onlinebereich →

Kein Spam. Abmeldung mit 1 Klick. Ihre Daten bleiben bei uns (werden nie weiterverkauft).

Methodik des Rankings

Filter: Modelle mit 30–250 Milliarden Parametern, die in Q4_K_M unter 96 GB bleiben (lässt 32 GB für macOS und einen sehr großen Kontext frei). Bonus: 70–150 Milliarden Parameter (Spitzenbedarf 128 GB) und MoE bis zu 250 Milliarden Parametern.

Berücksichtigte Kriterien:

  • Q4_K_M ≤ 96 GB
  • 70B Q8 komfortabel
  • MoE-Modelle mit 150B+ nutzbar
  • Stabiler 200k-Kontext

Die Bewertung ist vollständig transparent: konsultieren Sie unsere Methodik für Details zur Berechnung des VRAM-Bedarfs und der Tokens pro Sekunde.

Häufige Fragen

Mac 128 GB: Llama 70B Q8 oder 123B Q5?

Llama 70B Q8 (~75 GB) bei 10–14 Tokens/sec auf M4 Max. Mistral Large 123B Q5 (~85 GB) bei 8–12 Tokens/sec. Q8 auf 70B ist in der Regel nützlicher (fast-FP16, leicht besser als Q6 anderswo). 123B bleibt im Gesamtbereich leistungsfähiger.

Frontier MoE mit 128 GB: machbar?

DeepSeek V4 Flash 284B (MoE mit 13B aktiven Parametern) Q3_K_M (~140 GB) passt nicht in den Speicher — ein Mac Studio mit mindestens 192 GB ist erforderlich. Granite 4 Mamba 150B Q4 (~80 GB) passt in den Speicher. Für Frontier-Modelle ab 200B wechseln Sie zu Mac Studio Ultra.

MacBook Pro M5 Max 128 GB: Echt 128 GB in einem Laptop?

Ja, und es ist der einzige Laptop auf dem Markt in dieser Klasse. Das MacBook Pro mit 14 und 16 Zoll bietet sowohl mit M5 Max als auch mit M4 Max bis zu 128 GB vereinheitlichten Speicher, allerdings nur in der Variante mit 40 GPU-Kernen – beim M5 Max ist dies zugleich die einzige Variante mit 614 GB/s (460 GB/s bei der Variante mit 32 Kernen). Llama 70B Q8 + 128k Kontext unterwegs, ohne Cloud. Siehe die Seite des MacBook Pro M5 Max.

Mac 128 GB vs. Server 2× H100 80 GB?

2× H100 = ca. 10× schneller bei 70B (1700 GB/s pro Karte gegenüber 546 GB/s beim gemeinsamen Speicher). Allerdings ca. 80.000 € + 1 kW gegenüber einem Mac mit 128 GB für ca. 5.000 € + 100 W. Für die private Nutzung oder kleine Teams ist der Mac beim Preis pro GB klar überlegen.

Weiterführende Informationen

Die QuelLLM-Pakete Der maßgebliche Leitfaden für jeden Anwendungsfall
Alle Kits lebenslang — 49 €