Mittelstufe 12 Min.MacBook Pro

Welcher LLM für MacBook Pro M3 Pro / Max (18–128 GB) ?

Das MacBook Pro M3 Pro / Max (Ende 2023) bietet 2026 die ideale Balance unter den Laptops für lokale LLMs. Der M3 Max mit 16 Kernen bietet 400 GB/s Bandbreite und bis zu 128 GB gemeinsamen Speicher – genug, um den gesamten Open-Weight-Katalog von 2026 mit voller Präzision zu betreiben: Qwen 3.6 35B-A3B in Q8, Qwen 3.8 27B als dichtes Modell oder mehrere parallel geladene Modelle mit Kontexten von 128k und mehr. Achtung: Beim M3 Pro wurde die Speicherbandbreite reduziert (150 GB/s gegenüber 200 beim M2 Pro). Dieser Leitfaden zeigt, was jede Variante wirklich ermöglicht.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Getestet auf macOS 14+
Empfohlene Hardware

Kaufalternative für diesen Guide: MacBook Pro M5 Pro — 24 GB / 1 TB.

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.

#MBP M3 Pro / Max im Jahr 2026

Erscheinungsdatum
Oktober–November 2023. Wird weiterhin von macOS Sequoia und neueren Versionen unterstützt.
M3 Pro
11 oder 12 CPU-Kerne + 14 oder 18 GPU-Kerne, 150 GB/s (Rückschritt gegenüber dem M2 Pro), 18 oder 36 GB RAM.
M3 Max mit 14 Kernen
14 CPU-Kerne + 30 GPU-Kerne, 300 GB/s, RAM 36 oder 96 GB.
M3 Max mit 16 Kernen
16 CPU-Kerne + 40 GPU-Kerne, 400 GB/s, RAM 48, 64 oder 128 GB.
!
Die Falle beim M3 Pro
Apple hat die Speicherbandbreite des M3 Pro reduziert (150 GB/s gegenüber 200 beim M2 Pro). Das Ergebnis: Bei LLMs ist der M3 Pro langsamer als der M2 Pro. Wenn Sie nach einem M3 suchen, wählen Sie direkt den M3 Max – oder bleiben Sie bei einem gebrauchten M2 Pro.

#1. M3 Pro vs. M3 Max (Vorsicht vor der Falle)

M3 Pro 150 GB/s
Für 9B–12B brauchbar (~30 tok/s), stößt aber bei dichten Modellen ab 24B an seine Grenzen (~12 tok/s). Vermeiden Sie diese Option, wenn Sie dichte Modelle ab 24B nutzen möchten.
M3 Max mit 14 Kernen, 300 GB/s
Ein guter Kompromiss: Qwen 3.6 35B-A3B (MoE) mit 35–38 Tokens/s, Qwen 3.8 27B mit dichter Architektur mit 15–17 Tokens/s. Maximal 96 GB RAM.
M3 Max mit 16 Kernen, 400 GB/s
Die Spitzenklasse. +30 % Geschwindigkeit bei großen Modellen; ermöglicht 128 GB RAM für volle Q8-Präzision und mehrere Modelle parallel.

#2. 18 bis 128 GB: welche LLMs

Kompatible Modelle nach MBP-M3-Konfiguration
ModellQuantM3 Pro 18M3 Pro 36M3 Max 64M3 Max 96M3 Max 128
Qwen 3.5 9BQ5_K_M✓ 30✓ 32✓ 46✓ 48✓ 50
Gemma 4 12BQ5_K_M✓ 14✓ 16✓ 26✓ 28✓ 30
Mistral Small 24BQ5_K_M—✓ 10✓ 17✓ 19✓ 20
Qwen 3.8 27BQ5_K_M——✓ 15✓ 16✓ 17
Qwen 3.6 35B-A3BQ5_K_M——✓ 38✓ 40✓ 42
Qwen 3.6 35B-A3BQ8_0——✓ 32✓ 34✓ 36
Qwen3-Coder 30B-A3BQ8_0——✓ 33✓ 35✓ 37
GLM 4.7 FlashQ4_K_M——✓ 44✓ 46✓ 48

#3. Benchmarks in Tokens/Sek.

Größenordnungen — MBP M3 Max mit 16-Kern-GPU, 128 GB, Ollama, Netzbetrieb
ModellQ4_K_MQ5_K_MFlash Attn 8k
Qwen 3.5 9B54 t/s50 t/s48 t/s
Gemma 4 12B34 t/s30 t/s29 t/s
Mistral Small 24B22 t/s20 t/s19 t/s
Qwen 3.8 27B19 t/s17 t/s16 t/s
Qwen 3.6 35B-A3B46 t/s42 t/s40 t/s

#4. Installation und Konfiguration

Vollständige Einrichtung für ein MBP M3 Max mit 128 GB
brew install --cask ollama

# Relever la mémoire GPU (128 Go → 116 Go GPU)
sudo sysctl iogpu.wired_limit_mb=118784
echo "iogpu.wired_limit_mb=118784" | sudo tee -a /etc/sysctl.conf

# Flash Attention + KV cache Q8
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0

brew services restart ollama
ollama pull qwen3.6:35b

#5. Große Modelle mit voller Präzision und Flash Attention

Flash Attention war lange CUDA vorbehalten und ist seit Ende 2024 über llama.cpp und Ollama auch auf Metal verfügbar. Ein großer Gewinn bei langen Kontexten – unerlässlich, um Qwen 3.6 35B-A3B mit einem Kontext von 128k zu betreiben.

Das Mac-Kit

Lokale KI auf Ihrem Mac voll ausschöpfen: Unified Memory, MLX vs. GGUF, das passende Modell für Ihren Chip und auf Apple Silicon abgestimmte Einstellungen für Ollama und LM Studio.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates
Selbst kompiliertes llama.cpp — Qwen 3.6 35B mit 16k Kontext
./build/bin/llama-cli \
  -m ./models/qwen3.6-35b-a3b-q5_K_M.gguf \
  -ngl 99 -fa \
  -ctk q8_0 -ctv q8_0 \
  -c 16384 \
  --temp 0.7
→
Gemessene Verbesserungen mit Flash Attention auf dem M3 Max
4k Kontext: +8 %. 8k Kontext: +15 %. 16k Kontext: +25 %. Je mehr Kontext Sie haben, desto deutlicher ist der Gewinn. Auf dem M3 Max grundsätzlich aktivieren.

#6. Der M3 Max mit 128 GB: auf Workstation-Niveau

Qwen 3.6 35B-A3B Q8
Volle Präzision, maximale Qualität. ~36 tok/s (MoE, 3 Milliarden aktive Parameter). Die Variante mit 128 GB ermöglicht Q8 ohne Kompromisse beim Kontext.
Qwen 3.8 27B Q8
Das größte dichte Allzweckmodell in voller Präzision (~29 GB). ~15 Tokens/s. Das Modell, das 2026 „nahe an Copilot“ herankommt, mit Bildverarbeitung.
2 Modelle mit je 30B parallel
Ein Qwen 3.6 35B-A3B und ein Qwen3-Coder 30B-A3B gleichzeitig geladen. ~42 GB insgesamt. Für Agenten mit mehreren Fachbereichen.
128k+ Kontext bei 35B
Mit Q8-KV-Cache passt Qwen 3.6 35B-A3B mit einem Kontext von 128k in etwa 50 GB. Für die fundierte Analyse langer Dokumente.

#M3 Max vs. M4 Max

Bandbreite
M3 Max mit 16 Kernen = 400 GB/s. M4 Max mit 16 Kernen = 546 GB/s (+36 %).
Geschwindigkeit Qwen 3.6 35B-A3B
M3 Max ~40 Tok/s, M4 Max ~54 Tok/s. +35 % im realen Einsatz.
Maximaler Arbeitsspeicher
Identisch: 128 GB bei beiden Top-Konfigurationen.
Fazit
M4 Max beim Neukauf. Ein gebrauchter M3 Max zu einem um 25 % niedrigeren Preis ist ebenfalls ein hervorragendes Angebot.

#Häufig gestellte Fragen

Ist der M3 Pro wirklich langsamer als der M2 Pro für LLMs?+
Ja, bei dichten Modellen mit 24B oder mehr, wegen der Bandbreite (150 GB/s gegenüber 200). Bei Qwen 3.5 9B ist der Unterschied gering (~5 %). Bei Mistral Small 24B ist der M2 Pro 10–15 % schneller. Tipp: Wenn Sie gebraucht kaufen und dichte Modelle mit 24B oder mehr nutzen möchten, bevorzugen Sie den M2 Pro oder wechseln Sie direkt zum M3 Max.
Welcher MBP M3 soll verwendet werden, um große Modelle im Jahr 2026 zu betreiben?+
M3 Max mit 14 Kernen und 64 GB für Qwen 3.6 35B-A3B in Q8 (~35 tok/s, MoE), M3 Max mit 16 Kernen und 96–128 GB, um mehrere Modelle zu laden oder den Kontext auf 128k zu erweitern. Der M3 Pro mit 36 GB ist auf ein dichtes 24B-Modell beschränkt.
Welche Unterschiede gibt es in der Praxis zwischen dem M3 Max mit 14 und mit 16 Kernen?+
+30 % Bandbreite (300 vs. 400 GB/s), +33 % GPU-Kerne, optional 128 GB RAM. Bei einem großen 35B-MoE: +40 % Geschwindigkeit. Bei einem 9B-Modell: nur +8 %. Wenn Sie große Modelle nutzen möchten, ist das 16-Kern-Modell eine echte Investition.
128 GB RAM – ist das wirklich nützlich im Jahr 2026?+
Ja, wenn Sie Qwen 3.6 35B-A3B in Q8 (volle Präzision, bessere Qualität als Q4), zwei 30B-Modelle parallel oder ein Kontextfenster von 128k nutzen möchten. Für die übliche Nutzung reichen 64 GB völlig aus.
Macht Flash Attention auf dem M3 Max wirklich einen Unterschied?+
Ja, 15 bis 25 Prozent mehr Geschwindigkeit bei Kontexten von 8k bis 16k, ohne Verlust der Qualität. Standardmäßig aktivieren, indem OLLAMA_FLASH_ATTENTION=1 gesetzt wird.
Batterielaufzeit während eines Chats mit einem großen Modell?+
Etwa 1 Stunde 40 Minuten bei durchgehendem Chatten auf dem 16-Zoll-Modell mit M3 Max (Leistungsaufnahme ~50 W). Das reicht bequem für eine Sitzung unterwegs. Im Batchbetrieb mit einem großen Modell sollten Sie mit maximal 1 Stunde rechnen — nutzen Sie vorzugsweise Netzstrom.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.