Welcher LLM für MacBook Pro M3 Pro / Max (18–128 GB) ?
Das MacBook Pro M3 Pro / Max (Ende 2023) bietet 2026 die ideale Balance unter den Laptops für lokale LLMs. Der M3 Max mit 16 Kernen bietet 400 GB/s Bandbreite und bis zu 128 GB gemeinsamen Speicher – genug, um den gesamten Open-Weight-Katalog von 2026 mit voller Präzision zu betreiben: Qwen 3.6 35B-A3B in Q8, Qwen 3.8 27B als dichtes Modell oder mehrere parallel geladene Modelle mit Kontexten von 128k und mehr. Achtung: Beim M3 Pro wurde die Speicherbandbreite reduziert (150 GB/s gegenüber 200 beim M2 Pro). Dieser Leitfaden zeigt, was jede Variante wirklich ermöglicht.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: MacBook Pro M5 Pro — 24 GB / 1 TB.
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.
#MBP M3 Pro / Max im Jahr 2026
- Erscheinungsdatum
- Oktober–November 2023. Wird weiterhin von macOS Sequoia und neueren Versionen unterstützt.
- M3 Pro
- 11 oder 12 CPU-Kerne + 14 oder 18 GPU-Kerne, 150 GB/s (Rückschritt gegenüber dem M2 Pro), 18 oder 36 GB RAM.
- M3 Max mit 14 Kernen
- 14 CPU-Kerne + 30 GPU-Kerne, 300 GB/s, RAM 36 oder 96 GB.
- M3 Max mit 16 Kernen
- 16 CPU-Kerne + 40 GPU-Kerne, 400 GB/s, RAM 48, 64 oder 128 GB.
#1. M3 Pro vs. M3 Max (Vorsicht vor der Falle)
- M3 Pro 150 GB/s
- Für 9B–12B brauchbar (~30 tok/s), stößt aber bei dichten Modellen ab 24B an seine Grenzen (~12 tok/s). Vermeiden Sie diese Option, wenn Sie dichte Modelle ab 24B nutzen möchten.
- M3 Max mit 14 Kernen, 300 GB/s
- Ein guter Kompromiss: Qwen 3.6 35B-A3B (MoE) mit 35–38 Tokens/s, Qwen 3.8 27B mit dichter Architektur mit 15–17 Tokens/s. Maximal 96 GB RAM.
- M3 Max mit 16 Kernen, 400 GB/s
- Die Spitzenklasse. +30 % Geschwindigkeit bei großen Modellen; ermöglicht 128 GB RAM für volle Q8-Präzision und mehrere Modelle parallel.
#2. 18 bis 128 GB: welche LLMs
| Modell | Quant | M3 Pro 18 | M3 Pro 36 | M3 Max 64 | M3 Max 96 | M3 Max 128 |
|---|---|---|---|---|---|---|
| Qwen 3.5 9B | Q5_K_M | ✓ 30 | ✓ 32 | ✓ 46 | ✓ 48 | ✓ 50 |
| Gemma 4 12B | Q5_K_M | ✓ 14 | ✓ 16 | ✓ 26 | ✓ 28 | ✓ 30 |
| Mistral Small 24B | Q5_K_M | — | ✓ 10 | ✓ 17 | ✓ 19 | ✓ 20 |
| Qwen 3.8 27B | Q5_K_M | — | — | ✓ 15 | ✓ 16 | ✓ 17 |
| Qwen 3.6 35B-A3B | Q5_K_M | — | — | ✓ 38 | ✓ 40 | ✓ 42 |
| Qwen 3.6 35B-A3B | Q8_0 | — | — | ✓ 32 | ✓ 34 | ✓ 36 |
| Qwen3-Coder 30B-A3B | Q8_0 | — | — | ✓ 33 | ✓ 35 | ✓ 37 |
| GLM 4.7 Flash | Q4_K_M | — | — | ✓ 44 | ✓ 46 | ✓ 48 |
#3. Benchmarks in Tokens/Sek.
| Modell | Q4_K_M | Q5_K_M | Flash Attn 8k |
|---|---|---|---|
| Qwen 3.5 9B | 54 t/s | 50 t/s | 48 t/s |
| Gemma 4 12B | 34 t/s | 30 t/s | 29 t/s |
| Mistral Small 24B | 22 t/s | 20 t/s | 19 t/s |
| Qwen 3.8 27B | 19 t/s | 17 t/s | 16 t/s |
| Qwen 3.6 35B-A3B | 46 t/s | 42 t/s | 40 t/s |
#4. Installation und Konfiguration
#5. Große Modelle mit voller Präzision und Flash Attention
Flash Attention war lange CUDA vorbehalten und ist seit Ende 2024 über llama.cpp und Ollama auch auf Metal verfügbar. Ein großer Gewinn bei langen Kontexten – unerlässlich, um Qwen 3.6 35B-A3B mit einem Kontext von 128k zu betreiben.
Lokale KI auf Ihrem Mac voll ausschöpfen: Unified Memory, MLX vs. GGUF, das passende Modell für Ihren Chip und auf Apple Silicon abgestimmte Einstellungen für Ollama und LM Studio.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
#6. Der M3 Max mit 128 GB: auf Workstation-Niveau
- Qwen 3.6 35B-A3B Q8
- Volle Präzision, maximale Qualität. ~36 tok/s (MoE, 3 Milliarden aktive Parameter). Die Variante mit 128 GB ermöglicht Q8 ohne Kompromisse beim Kontext.
- Qwen 3.8 27B Q8
- Das größte dichte Allzweckmodell in voller Präzision (~29 GB). ~15 Tokens/s. Das Modell, das 2026 „nahe an Copilot“ herankommt, mit Bildverarbeitung.
- 2 Modelle mit je 30B parallel
- Ein Qwen 3.6 35B-A3B und ein Qwen3-Coder 30B-A3B gleichzeitig geladen. ~42 GB insgesamt. Für Agenten mit mehreren Fachbereichen.
- 128k+ Kontext bei 35B
- Mit Q8-KV-Cache passt Qwen 3.6 35B-A3B mit einem Kontext von 128k in etwa 50 GB. Für die fundierte Analyse langer Dokumente.
#M3 Max vs. M4 Max
- Bandbreite
- M3 Max mit 16 Kernen = 400 GB/s. M4 Max mit 16 Kernen = 546 GB/s (+36 %).
- Geschwindigkeit Qwen 3.6 35B-A3B
- M3 Max ~40 Tok/s, M4 Max ~54 Tok/s. +35 % im realen Einsatz.
- Maximaler Arbeitsspeicher
- Identisch: 128 GB bei beiden Top-Konfigurationen.
- Fazit
- M4 Max beim Neukauf. Ein gebrauchter M3 Max zu einem um 25 % niedrigeren Preis ist ebenfalls ein hervorragendes Angebot.
#Häufig gestellte Fragen
Ist der M3 Pro wirklich langsamer als der M2 Pro für LLMs?+
Welcher MBP M3 soll verwendet werden, um große Modelle im Jahr 2026 zu betreiben?+
Welche Unterschiede gibt es in der Praxis zwischen dem M3 Max mit 14 und mit 16 Kernen?+
128 GB RAM – ist das wirklich nützlich im Jahr 2026?+
Macht Flash Attention auf dem M3 Max wirklich einen Unterschied?+
Batterielaufzeit während eines Chats mit einem großen Modell?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.