Welcher LLM für MacBook Pro M2 Pro / Max (16–96 GB) ?
Ein MacBook Pro M2 Pro bietet mit 16 GB problemlos Platz für ein Modell mit 8–9 Milliarden Parametern und mit 32 GB für eines mit 24–32 Milliarden Parametern; ein M2 Max mit 64 oder 96 GB ist die einzige Variante dieser Generation, die Platz für ein 70B-Modell in Q4 (etwa 40 GB) und für zwei Modelle mit jeweils 20–30 Milliarden Parametern gleichzeitig bietet. Die Geschwindigkeit hängt von der Bandbreite ab: 200 GB/s beim M2 Pro, 400 GB/s beim M2 Max, also bei gleichem Modell nahezu doppelt so viele Tokens pro Sekunde.
Das im Januar 2023 erschienene MacBook Pro M2 Pro / Max gehört weiterhin zu den leistungsfähigsten Laptops für lokale KI: Lüfter, 400 GB/s Speicherbandbreite beim M2 Max und bis zu 96 GB vereinheitlichter Speicher. Diese Seite erklärt, was die einzelnen Speicherkonfigurationen ermöglichen, welche Ergebnisse die veröffentlichten Messungen liefern, warum eine Verdopplung der Bandbreite die Geschwindigkeit nicht verdoppelt und wann sich der Umstieg auf einen M4 Max lohnt.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: MacBook Pro M5 Pro — 24 GB / 1 TB.
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#MacBook Pro M2 Pro / Max im Jahr 2026: die relevanten technischen Daten
Bei der Vorstellung kündigte Apple für den M2 Pro eine Bandbreite von 200 GB/s und bis zu 32 GB gemeinsamen Speicher (Unified Memory) an, für den M2 Max 400 GB/s, bis zu 96 GB und eine GPU mit bis zu 38 Kernen. Apple stellte diese 96 GB als Erweiterung der Grenzen des Grafikspeichers in einem Laptop dar. Der Speicher ist mit dem Prozessor verlötet, daher wird die Konfiguration beim Kauf festgelegt und lässt sich danach nicht mehr ändern.
| Chip | Bandbreite | Mögliche Speicherkapazität | GPU |
|---|---|---|---|
| M2 Pro | 200 GB/s | 16 oder 32 GB | 16 oder 19 Kerne |
| M2 Max | 400 GB/s | 32, 64 oder 96 GB | 30 oder 38 Kerne |
Die aktive Kühlung ist der zweite Vorteil gegenüber einem MacBook Air: Das MacBook Pro kann längere Belastungen bewältigen, ohne dass der Chip deutlich langsamer werden muss. Apple bietet bei einigen Modellen auch einen Hochleistungsmodus an, in dem die Lüfter schneller drehen dürfen; diese Einstellung können Sie bei längeren Generierungsvorgängen ausprobieren, allerdings auf Kosten eines höheren Geräuschpegels.
#M2 Pro oder M2 Max: Was die Bandbreite wirklich verändert
Lokale KI auf Ihrem Mac voll ausschöpfen: Unified Memory, MLX vs. GGUF, das passende Modell für Ihren Chip und auf Apple Silicon abgestimmte Einstellungen für Ollama und LM Studio.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Bei der Textgenerierung werden für jedes Token sämtliche aktiven Modellgewichte gelesen. Die maximale Geschwindigkeit ergibt sich daher aus der Bandbreite geteilt durch die Größe der Gewichte. Ein M2 Max mit 400 GB/s kann theoretisch doppelt so schnell sein wie ein M2 Pro mit 200 GB/s. Die im llama.cpp-Repository veröffentlichten Messungen zeigen, dass dies nur teilweise zutrifft.
| Chip (GPU-Kerne) | Bandbreite | Q4_0 | Q8_0 | F16 |
|---|---|---|---|---|
| M2 Pro (19) | 200 GB/s | 38,86 t/s | 23,01 t/s | 13,06 t/s |
| M2 Max (30) | 400 GB/s | 60,99 t/s | 39,97 t/s | 24,16 t/s |
| M2 Max (38) | 400 GB/s | 65,95 t/s | 41,83 t/s | 24,65 t/s |
Bei einem 7B-Modell in Q4_0 erreicht der M2 Max nur das 1,6- bis 1,7-Fache der Leistung des M2 Pro. Bei demselben Modell in F16 mit etwa 13 GB steigt dieser Faktor auf fast 1,9. Die Rechnung erklärt das: Ein kleines Modell wird so schnell gelesen, dass andere begrenzende Faktoren (Rechenleistung, Latenz, Overhead) wieder den Ausschlag geben, während ein großes Modell den Speicher tatsächlich voll auslastet. Die praktische Konsequenz widerspricht der Intuition: Je größer das Modell, desto eher rechtfertigt der M2 Max seinen Preis. Für ein 7B-Modell reicht ein M2 Pro völlig aus.
#Von 16 bis 96 GB: Was hineinpasst und wo es knapp bleibt
Bei Apple Silicon hat die GPU standardmäßig keinen Zugriff auf den gesamten Arbeitsspeicher: Laut den Diskussionen im llama.cpp-Repository gibt Metal zwischen zwei Dritteln und drei Vierteln davon frei. Bei 16 GB können Sie mit etwa 10 bis 12 GB für das Modell und seinen Kontext rechnen, bei 96 GB mit etwa 64 bis 72 GB. Die Grenze lässt sich über eine Systemeinstellung anheben, die im zugehörigen Leitfaden ausführlich beschrieben wird. Eine Überschreitung kann jedoch dazu führen, dass der Rechner einfriert.
| Modell | Q4-Gewichte | M2 Pro 16 GB | M2 Pro 32 GB | M2 Max 64 GB | M2 Max 96 GB |
|---|---|---|---|---|---|
| Qwen 3.5 9B | 6 GB | Komfortabel | Ja | Ja | Ja |
| Gemma 4 12B | 7 GB | Knapp | Ja | Ja | Ja |
| Mistral Small 3.2 24B | 14 GB | Nein | Ja | Ja | Ja |
| Qwen 3.5 27B | 16 GB | Nein | Ja, mit moderater Kontextlänge | Ja | Ja |
| Qwen3-Coder 30B-A3B (MoE) | 19 GB | Nein | Ja, mit moderater Kontextlänge | Ja | Ja |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | Nein | Knapp | Ja | Ja |
| Llama 3.3 70B | 40 GB | Nein | Nein | Ja, kurzer Kontext | Ja |
MoE-Modelle wie Qwen3-Coder 30B-A3B oder Qwen 3.6 35B-A3B belegen 19 bzw. 21 GB, aktivieren aber nur etwa 3 Milliarden Parameter pro Token: Bei gleicher Speicherkapazität generieren sie deutlich schneller als ein dichtes 27B-Modell. Das ist bei 32 GB die Option mit dem besten Preis-Leistungs-Verhältnis. Bei 96 GB liegt der Vorteil des M2 Max weniger darin, ein einziges sehr großes Modell zu laden, als darin, zwei Modelle gleichzeitig im Speicher zu halten, beispielsweise ein Chat-Modell und ein Code-Modell.
#Veröffentlichte Durchsatzwerte: Was sich feststellen lässt und was nicht
Wir haben keine eigenen Messungen auf diesem Rechner, und die Tokens pro Sekunde hängen vom Modell, der Quantisierung, dem Kontext und der Version von llama.cpp oder Ollama ab. Die einzigen Messungen, die wir zitieren, wurden von Nutzern mit einem Llama 7B veröffentlicht und zeigen die Größenordnung. Für ein neueres Modell bleibt die Berechnung „Bandbreite geteilt durch Modellgröße“ der richtige Ansatz, unter Berücksichtigung der oben angegebenen Fehlermarge.
Die Promptverarbeitung folgt einer anderen Logik: Die Tabelle von llama.cpp gibt für dasselbe Llama 7B in F16 bei der Promptverarbeitung 384 t/s auf einem M2 Pro mit 19 Kernen und 756 t/s auf einem M2 Max mit 38 Kernen an. Die Anzahl der GPU-Kerne beeinflusst diese Phase, nicht die Generierung. Bei RAG oder der Analyse eines langen Dokuments beträgt die Wartezeit bis zum ersten Wort auf einem M2 Max daher etwa die Hälfte der Wartezeit auf einem M2 Pro.
#Ollama auf dem Mac installieren und richtig verwenden
Ollama erfordert macOS Sonoma (14) oder neuer. Für den Mac erläutert die offizielle FAQ, dass die Umgebungsvariablen mit launchctl gesetzt werden, wenn Ollama als Anwendung läuft, und dass die Anwendung anschließend neu gestartet werden muss. Exporte in einem Terminal reichen nicht aus, da die Anwendung diese Variablen nicht sieht.
Die FAQ von Ollama gibt an, dass der in q8_0 quantisierte K/V-Cache etwa halb so viel Speicher benötigt wie das standardmäßige f16-Format und dass Flash Attention aktiviert sein muss, um davon zu profitieren. Bei einem 70B-Modell mit langem Kontext sorgt diese Einstellung dafür, dass der Cache in den Speicher passt. Eine Einschränkung sollten Sie kennen: Die Quantisierung des Caches kann bei manchen Modellen die Qualität leicht verschlechtern; testen Sie sie anhand Ihrer eigenen Anwendungsfälle, bevor Sie sie beibehalten.
#Welches Modell für welchen Zweck
- Allgemeiner Chat
- Ein Modell mit 8B bis 12B Parametern (Qwen 3.5 9B, Gemma 4 12B) antwortet auf dem M2 Pro schnell; ab 32 GB wird ein 27B-Modell für ein gepflegteres Französisch interessant.
- Code
- Ein Code-MoE wie Qwen3-Coder 30B-A3B mit 32 GB oder mehr, oder ein Code-Agent-Modell mit 24 Milliarden Parametern wie Devstral Small 2 (14 GB in Q4). Für die Inline-Autovervollständigung reicht ein 7B-Modell.
- Dokumentbasiertes RAG
- Gemma 4 12B für Geschwindigkeit, ein 24B-Modell für die Qualität des logischen Denkens; begrenzen Sie den Kontext, damit sich die Wartezeit bis zum ersten Wort nicht verlängert.
- Lange Analysen, Agenten
- Bei 64 GB oder mehr: Qwen 3.6 35B-A3B als schnelles MoE-Modell oder ein 70B-Modell für die Qualität, sofern Sie bestenfalls etwa 10 Tokens/s akzeptieren (400 ÷ 40).
Bei Reasoning-Modellen ist Vorsicht geboten: Sie erzeugen vor der Antwort lange Denkblöcke, wodurch sich die Anzahl der zu generierenden Tokens vervielfacht. Auf einem Rechner mit 60 Tokens/s dauern zehntausend Denktokens fast drei Minuten. Deaktivieren Sie bei einfachen Fragen den Denkmodus, wenn das Modell dies erlaubt.
#Im Akkubetrieb und unter längerer Last: Was sich ändert
Das MacBook Pro ist dafür ausgelegt, länger durchzuhalten als ein Air, bleibt aber ein Laptop. Zwei Einstellungen beeinflussen die Durchsatzraten: der Energiemodus (im Akkubetrieb kann macOS die Leistung begrenzen) und, bei Modellen, die ihn anbieten, der Hochleistungsmodus. Laut Apple können die Lüfter in diesem Modus schneller laufen, um bei sehr intensiven Arbeitslasten eine höhere Leistung aufrechtzuerhalten, allerdings mit zusätzlicher Geräuschentwicklung. Schließen Sie für eine Generierung, die mehrere Minuten dauert, das Netzteil an und probieren Sie diesen Modus aus.
#Soll man zu einem M4 Max wechseln?
Der M4 Max erreicht laut Apple 546 GB/s und 128 GB Speicher. In der llama.cpp-Tabelle steigt die Generierungsgeschwindigkeit eines Llama 7B in Q4_0 von 65,95 t/s auf einem M2 Max mit 38 Kernen auf 83,06 t/s auf einem M4 Max mit 40 Kernen: etwa 26 % mehr. Der Leistungsgewinn macht sich bei intensiver Nutzung bemerkbar, aber der M2 Max mit 96 GB behält einen Vorteil bei der Speicherkapazität gegenüber einem M4 Pro, der auf 64 GB begrenzt ist.
| Situation | Empfehlung |
|---|---|
| Sie verwenden hauptsächlich 8–14B-Modelle | Ein M2 Pro mit 32 GB reicht aus; zahlen Sie nicht für zusätzliche Bandbreite. |
| Sie laden täglich Modelle mit 27 bis 35 Milliarden Parametern | M2 Max mit 64 oder 96 GB: Hier lohnt er sich |
| Sie möchten ein 70B-Modell komfortabel betreiben oder zwei Modelle gleichzeitig im Speicher halten | M2 Max 96 GB oder M4 Max 128 GB, falls Geschwindigkeit von Bedeutung ist |
| Sie suchen einen Server ohne Bildschirm | Ein Mac mini M4 Pro oder ein Mac Studio ist besser geeignet |
- MacBook Pro M3
- MacBook Pro M4
- Mac Studio für 64 bis 512 GB
- Hardware-Übersicht: MacBook Pro M4 Max
- Quelle: llama.cpp-Messungen auf Apple-Chips
- Quelle: Apple, Einführung des MacBook Pro M2 Pro und M2 Max
- Quelle: Offizielle Ollama-FAQ
#Häufig gestellte Fragen
Ist ein MacBook Pro mit M2 Pro und 16 GB für lokale KI ausreichend?+
Was ist der Unterschied zwischen dem M2 Max mit 30 und mit 38 GPU-Kernen?+
Kann man zwei LLM gleichzeitig auf einem M2 Max 64 GB laufen lassen?+
Welches Modell für Französisch auf einem MacBook Pro M2 Max?+
Wird der M2 Max bei der Inferenz heißer als der M1 Max?+
Muss MLX neben Ollama auf einem M2 Max installiert werden?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.