Welcher LLM auf MacBook Pro M1 Pro / Max (16–64 GB) ?
Das Ende 2021 erschienene MacBook Pro M1 Pro / Max bleibt auch 2026 ein bemerkenswerter Rechner für lokale KI, besonders in der Max-Version mit 64 GB. Eine Bandbreite von 200 bis 400 GB/s, aktive Lüfter (keine Drosselung), bis zu 64 GB gemeinsamer Speicher: Ein MoE-Modell Qwen 3.6 35B läuft mit etwa 34 Tokens pro Sekunde, und ein 30B-Modell passt in Q8 bei voller Qualität in den Speicher — etwas, das auf einem vergleichbaren herkömmlichen PC-Notebook nicht möglich ist. Dieser Leitfaden erläutert im Detail, wie Sie diesen Rechner heute nutzen können.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: MacBook Pro M5 Pro — 24 GB / 1 TB.
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#MBP M1 Pro / Max im Jahr 2026
- Erscheinungsdatum
- Oktober 2021. Im Jahr 2026 weiterhin unter macOS Sequoia (15) unterstützt.
- M1 Pro
- 8 oder 10 CPU-Kerne + 14 oder 16 GPU-Kerne, Bandbreite 200 GB/s, RAM 16 oder 32 GB
- M1 Max
- 10 CPU-Kerne + 24 oder 32 GPU-Kerne, Bandbreite 400 GB/s, RAM 32 oder 64 GB
- Kühlung
- Aktive Lüfter – keine Drosselung beim LLM-Betrieb. Kann 24 Stunden ununterbrochen laufen.
- Gebrauchtwert 2026
- MBP M1 Pro und M1 Max: gebraucht, Preis variiert je nach Zustand
#1. M1 Pro vs M1 Max: eine Wahl treffen
- M1 Pro (200 GB/s)
- Hervorragend für Modelle mit 8–12 Milliarden Parametern. Ein MoE mit 30–35 Milliarden Parametern (Qwen 3.6 35B-A3B) passt in den Speicher der 32-GB-Version, aber nicht in den der 16-GB-Version.
- M1 Max (400 GB/s)
- 2× die Bandbreite = 2× die Inferenzgeschwindigkeit bei Modellen ≥ 13B. Unverzichtbar, um ein 30B-Modell in Q8 mit voller Qualität zu betreiben.
- GPU-Kerne
- Der M1 Max mit 32 GPU-Kernen ist bei 8B-Modellen 15–20 % schneller als die Variante mit 24 GPU-Kernen. Bei Modellen mit 27–35 Milliarden Parametern wird der Abstand größer.
#2. 16, 32, 64 GB: welche Modelle
| Modell | Quant | RAM des Modells | M1 Pro 16 GB | M1 Pro 32 GB | M1 Max 64 GB |
|---|---|---|---|---|---|
| Qwen 3.5 9B | Q5_K_M | 7 GB | 28 | 31 | 43 |
| Granite 4.2 8B | Q5_K_M | 6 GB | 30 | 34 | 47 |
| Gemma 4 12B | Q5_K_M | 9 GB | 18 | 21 | 30 |
| Qwen 3.8 27B | Q4_K_M | 18 GB | — | 11 | 18 |
| Mistral Small 24B | Q5_K_M | 16 GB | — | 10 | 18 |
| Qwen 3.6 35B-A3B (MoE) | Q4_K_M | 23 GB | — | 22 | 34 |
| Qwen3-Coder 30B-A3B | Q8_0 | 32 GB | — | — | 24 |
#3. Benchmarks in Tokens/Sek.
| Modell | Q4_K_M | Q5_K_M | Q8_0 |
|---|---|---|---|
| Qwen 3.5 9B | 46 t/s | 43 t/s | 28 t/s |
| Granite 4.2 8B | 50 t/s | 47 t/s | 30 t/s |
| Gemma 4 12B | 32 t/s | 30 t/s | 19 t/s |
| Qwen 3.8 27B | 18 t/s | 16 t/s | 10 t/s |
| Qwen 3.6 35B-A3B | 34 t/s | — | 22 t/s |
#4. Installation und Setup
#5. Die GPU-Speichergrenze ermitteln
Auf einem MBP M1 Max mit 64 GB Speicher weist macOS der GPU standardmäßig etwa 43 GB zu. Um ein 30–35B-Modell in Q8 (~35 GB) mit einem erweiterten Kontext zu laden — allein der KV-Cache eines 256k-Kontexts kann mehr als 10 GB beanspruchen — überschreitet der gesamte Speicherbedarf schnell die 43 GB, sodass die Obergrenze angehoben werden muss.
Ihr MacBook Pro M1 kann mehr ausführen, als Sie denken. Das Mac-Kit zeigt, wie Sie die GPU-Speichergrenze erhöhen (Kap. 2), das passende Modell für Ihren Chip auswählen (Kap. 4) und Probleme mit Metal, Speicher und Swap beheben (Kap. 14).
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
#6. Ein großes Modell aus dem Jahr 2026 auf dem M1 Max ausführen
Das MBP M1 Max mit 64 GB führt die größten Modelle des Jahres 2026 in voller Qualität aus: ein MoE-Modell mit 30–35B in Q8 oder mehrere parallel geladene Modelle. Hier ist die optimale Konfiguration:
#Upgrade auf M3 Max oder M4 Max?
- M3 Max mit 16 Kernen (2023)
- 50 % mehr reine Geschwindigkeit gegenüber dem M1 Max. 128 GB RAM möglich (statt 64 GB). Rechtfertigt das Upgrade, wenn Sie mit einem MoE-Modell mit 30–35B mehr als 50 Tokens/s erreichen möchten.
- M4 Max mit 16 Kernen (2024)
- +90 % im Vergleich zum M1 Max, Bandbreite 546 GB/s. 128 GB RAM. Bestes Mac-Laptop für LLM im Jahr 2026.
- Beim M1 Max mit 64 GB bleiben
- Absolut praktikabel: 35B-MoE mit ~34 Tokens/s, dichtes 27B-Modell mit 18 Tokens/s. Kein Grund, vor 2027 aufzurüsten, wenn Ihnen die aktuelle Geschwindigkeit genügt.
#Häufig gestellte Fragen
MBP M1 Pro 16 GB oder M1 Max 32 GB für lokale KI?+
Kann ein großes Modell auf dem MBP M1 Max 32 GB laufen?+
Ist der MBP M1 Pro besser als ein PC mit RTX 3060 für LLMs?+
Drehen die Lüfter bei der LLM-Inferenz stark auf?+
Sollten Sie für LLMs den 16-Zoll- oder den 14-Zoll-Bildschirm wählen?+
Ollama oder MLX auf MBP M1 Max?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.