Mittelstufe 11 Min.MacBook Pro

Welcher LLM auf MacBook Pro M1 Pro / Max (16–64 GB) ?

Das Ende 2021 erschienene MacBook Pro M1 Pro / Max bleibt auch 2026 ein bemerkenswerter Rechner für lokale KI, besonders in der Max-Version mit 64 GB. Eine Bandbreite von 200 bis 400 GB/s, aktive Lüfter (keine Drosselung), bis zu 64 GB gemeinsamer Speicher: Ein MoE-Modell Qwen 3.6 35B läuft mit etwa 34 Tokens pro Sekunde, und ein 30B-Modell passt in Q8 bei voller Qualität in den Speicher — etwas, das auf einem vergleichbaren herkömmlichen PC-Notebook nicht möglich ist. Dieser Leitfaden erläutert im Detail, wie Sie diesen Rechner heute nutzen können.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Getestet auf macOS 14+
Empfohlene Hardware

Kaufalternative für diesen Guide: MacBook Pro M5 Pro — 24 GB / 1 TB.

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#MBP M1 Pro / Max im Jahr 2026

Erscheinungsdatum
Oktober 2021. Im Jahr 2026 weiterhin unter macOS Sequoia (15) unterstützt.
M1 Pro
8 oder 10 CPU-Kerne + 14 oder 16 GPU-Kerne, Bandbreite 200 GB/s, RAM 16 oder 32 GB
M1 Max
10 CPU-Kerne + 24 oder 32 GPU-Kerne, Bandbreite 400 GB/s, RAM 32 oder 64 GB
Kühlung
Aktive Lüfter – keine Drosselung beim LLM-Betrieb. Kann 24 Stunden ununterbrochen laufen.
Gebrauchtwert 2026
MBP M1 Pro und M1 Max: gebraucht, Preis variiert je nach Zustand
→
Warum das 2026 ein guter Deal ist
Ein gebrauchter MBP M1 Max mit 64 GB (Preis variabel) kann die besten MoE-Modelle von 2026 (Qwen 3.6 35B, Qwen3-Coder 30B) in Q8 mit voller Qualität ausführen. Für dieselbe LLM-Kapazität auf einem PC benötigt man 2 × RTX 3090 (gebraucht, Preis variabel) sowie eine kompatible CPU, ein Mainboard und ein Netzteil (~800 €). Das ergibt insgesamt beträchtliche Kosten sowie ein lautes und energiehungriges System.

#1. M1 Pro vs M1 Max: eine Wahl treffen

M1 Pro (200 GB/s)
Hervorragend für Modelle mit 8–12 Milliarden Parametern. Ein MoE mit 30–35 Milliarden Parametern (Qwen 3.6 35B-A3B) passt in den Speicher der 32-GB-Version, aber nicht in den der 16-GB-Version.
M1 Max (400 GB/s)
2× die Bandbreite = 2× die Inferenzgeschwindigkeit bei Modellen ≥ 13B. Unverzichtbar, um ein 30B-Modell in Q8 mit voller Qualität zu betreiben.
GPU-Kerne
Der M1 Max mit 32 GPU-Kernen ist bei 8B-Modellen 15–20 % schneller als die Variante mit 24 GPU-Kernen. Bei Modellen mit 27–35 Milliarden Parametern wird der Abstand größer.

#2. 16, 32, 64 GB: welche Modelle

Empfohlene Modelle nach MBP-M1-Konfiguration
ModellQuantRAM des ModellsM1 Pro 16 GBM1 Pro 32 GBM1 Max 64 GB
Qwen 3.5 9BQ5_K_M7 GB283143
Granite 4.2 8BQ5_K_M6 GB303447
Gemma 4 12BQ5_K_M9 GB182130
Qwen 3.8 27BQ4_K_M18 GB—1118
Mistral Small 24BQ5_K_M16 GB—1018
Qwen 3.6 35B-A3B (MoE)Q4_K_M23 GB—2234
Qwen3-Coder 30B-A3BQ8_032 GB——24

#3. Benchmarks in Tokens/Sek.

MBP M1 Max mit 32-Kern-GPU, 64 GB, Ollama, Netzbetrieb — Größenordnungen
ModellQ4_K_MQ5_K_MQ8_0
Qwen 3.5 9B46 t/s43 t/s28 t/s
Granite 4.2 8B50 t/s47 t/s30 t/s
Gemma 4 12B32 t/s30 t/s19 t/s
Qwen 3.8 27B18 t/s16 t/s10 t/s
Qwen 3.6 35B-A3B34 t/s—22 t/s

#4. Installation und Setup

Terminal — vollständige Einrichtung
# Homebrew
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

# Ollama + démarrage auto
brew install --cask ollama
brew services start ollama

# Modèles conseillés
ollama run qwen3.5:9b        # M1 Pro 16 Go
ollama run qwen3.8:27b       # M1 Pro 32 Go
ollama run qwen3.6:35b       # M1 Max 64 Go (MoE 35B)

#5. Die GPU-Speichergrenze ermitteln

Auf einem MBP M1 Max mit 64 GB Speicher weist macOS der GPU standardmäßig etwa 43 GB zu. Um ein 30–35B-Modell in Q8 (~35 GB) mit einem erweiterten Kontext zu laden — allein der KV-Cache eines 256k-Kontexts kann mehr als 10 GB beanspruchen — überschreitet der gesamte Speicherbedarf schnell die 43 GB, sodass die Obergrenze angehoben werden muss.

Das Mac-Kit

Ihr MacBook Pro M1 kann mehr ausführen, als Sie denken. Das Mac-Kit zeigt, wie Sie die GPU-Speichergrenze erhöhen (Kap. 2), das passende Modell für Ihren Chip auswählen (Kap. 4) und Probleme mit Metal, Speicher und Swap beheben (Kap. 14).

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen
Den zuweisbaren GPU-Speicher erhöhen
# Vérifier la valeur actuelle
sysctl iogpu.wired_limit_mb

# Relever à 56 Go (64 Go - 8 Go système)
sudo sysctl iogpu.wired_limit_mb=57344

# Rendre permanent
echo "iogpu.wired_limit_mb=57344" | sudo tee -a /etc/sysctl.conf
!
Lassen Sie ≥ 8 GB für macOS frei
Unterhalb dieser Grenze lagert das System Speicher auf das Laufwerk aus, und die Inferenz wird drastisch langsamer. 8 GB sind die minimale Reserve auf einem MBP mit 64 GB; beschränken Sie sich nur dann auf 6 GB, wenn Sie alle Electron-Apps schließen und keinen Browser verwenden.

#6. Ein großes Modell aus dem Jahr 2026 auf dem M1 Max ausführen

Das MBP M1 Max mit 64 GB führt die größten Modelle des Jahres 2026 in voller Qualität aus: ein MoE-Modell mit 30–35B in Q8 oder mehrere parallel geladene Modelle. Hier ist die optimale Konfiguration:

MoE Qwen 3.6 35B auf M1 Max 64 GB
# Augmenter la RAM GPU (fait une seule fois)
sudo sysctl iogpu.wired_limit_mb=57344

# Activer flash attention + KV cache quantifié
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
brew services restart ollama

# Lancer le modèle
ollama run qwen3.6:35b
# Comptez ~34 tokens/seconde (MoE, 3B actifs) — contexte étendu confortable
i
Batterielaufzeit bei großen Modellen
Etwa 1 Stunde und 30 Minuten Akkulaufzeit bei kontinuierlichem Chatten mit einem MoE-35B-Modell (Leistungsaufnahme ~40 W). Schließen Sie das Gerät für längere Sitzungen ans Stromnetz an — der MBP M1 Max drosselt die GPU bei niedrigem Akkustand stark.

#Upgrade auf M3 Max oder M4 Max?

M3 Max mit 16 Kernen (2023)
50 % mehr reine Geschwindigkeit gegenüber dem M1 Max. 128 GB RAM möglich (statt 64 GB). Rechtfertigt das Upgrade, wenn Sie mit einem MoE-Modell mit 30–35B mehr als 50 Tokens/s erreichen möchten.
M4 Max mit 16 Kernen (2024)
+90 % im Vergleich zum M1 Max, Bandbreite 546 GB/s. 128 GB RAM. Bestes Mac-Laptop für LLM im Jahr 2026.
Beim M1 Max mit 64 GB bleiben
Absolut praktikabel: 35B-MoE mit ~34 Tokens/s, dichtes 27B-Modell mit 18 Tokens/s. Kein Grund, vor 2027 aufzurüsten, wenn Ihnen die aktuelle Geschwindigkeit genügt.

#Häufig gestellte Fragen

MBP M1 Pro 16 GB oder M1 Max 32 GB für lokale KI?+
Der M1 Max mit 32 GB bietet einen echten Zugewinn: doppelte Bandbreite (400 gegenüber 200 GB/s) = doppelte Geschwindigkeit bei Modellen ab 13B und 20 GB zusätzlich nutzbarer Speicher. Wenn Sie hingegen nur 8–9B-Modelle ausführen möchten, reicht der M1 Pro mit 16 GB völlig aus.
Kann ein großes Modell auf dem MBP M1 Max 32 GB laufen?+
Ja: Ein MoE-Modell mit 30–35B Parametern in Q4 (~23 GB, wie Qwen 3.6 35B-A3B) passt in 32 GB Speicher und läuft dank seiner 3B aktiven Parameter schnell. Ein 30B-Modell in Q8 (~32 GB) oder ein dichtes Modell mit ≥ 27B Parametern in Q8 reizen dagegen die 32 GB aus: Wechseln Sie dann auf 64 GB.
Ist der MBP M1 Pro besser als ein PC mit RTX 3060 für LLMs?+
Für Qwen 3.5 9B Q4: vergleichbare Geschwindigkeit (30–45 Tok/s). Vorteile des Mac: 16 GB nutzbarer Speicher gegenüber 12 GB VRAM, leiser Betrieb, keine Treiber. Vorteile des PC: CUDA-Ökosystem, einfacheres Fine-Tuning.
Drehen die Lüfter bei der LLM-Inferenz stark auf?+
Bei einem großen Modell im kontinuierlichen Chatbetrieb hörbar (RPM ~4000, vergleichbar mit einem MacBook Pro mit Intel-Prozessor von 2019 beim Kompilieren). Bei 8–12B leise (RPM ~2500). Deutlich leiser als ein PC-Gaming-Laptop bei gleicher GPU-Last.
Sollten Sie für LLMs den 16-Zoll- oder den 14-Zoll-Bildschirm wählen?+
Kein Einfluss auf die Leistung. Das 16-Zoll-Modell kann Wärme besser ableiten (größeres Gehäuse) und hält deshalb die Last etwas länger durch. 14 Zoll, wenn die Mobilität Vorrang hat, 16 Zoll, wenn lange Sitzungen wichtiger sind.
Ollama oder MLX auf MBP M1 Max?+
Ollama bleibt die Grundlage für 95 % der Anwendungen (einfach, robust, OpenAI-API). MLX ist interessant, um ein Modell mit 8–9 Milliarden Parametern lokal zu fine-tunen oder native MLX-Modelle zu nutzen, die vom M1 Max profitieren. Beide lassen sich ohne Konflikte nebeneinander betreiben.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.