Mittelstufe 11 Min.MacBook Pro

Welcher LLM für MacBook Pro M2 Pro / Max (16–96 GB) ?

Direkte Antwort

Ein MacBook Pro M2 Pro bietet mit 16 GB problemlos Platz für ein Modell mit 8–9 Milliarden Parametern und mit 32 GB für eines mit 24–32 Milliarden Parametern; ein M2 Max mit 64 oder 96 GB ist die einzige Variante dieser Generation, die Platz für ein 70B-Modell in Q4 (etwa 40 GB) und für zwei Modelle mit jeweils 20–30 Milliarden Parametern gleichzeitig bietet. Die Geschwindigkeit hängt von der Bandbreite ab: 200 GB/s beim M2 Pro, 400 GB/s beim M2 Max, also bei gleichem Modell nahezu doppelt so viele Tokens pro Sekunde.

Das im Januar 2023 erschienene MacBook Pro M2 Pro / Max gehört weiterhin zu den leistungsfähigsten Laptops für lokale KI: Lüfter, 400 GB/s Speicherbandbreite beim M2 Max und bis zu 96 GB vereinheitlichter Speicher. Diese Seite erklärt, was die einzelnen Speicherkonfigurationen ermöglichen, welche Ergebnisse die veröffentlichten Messungen liefern, warum eine Verdopplung der Bandbreite die Geschwindigkeit nicht verdoppelt und wann sich der Umstieg auf einen M4 Max lohnt.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Getestet auf macOS 14+
Empfohlene Hardware

Kaufalternative für diesen Guide: MacBook Pro M5 Pro — 24 GB / 1 TB.

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#MacBook Pro M2 Pro / Max im Jahr 2026: die relevanten technischen Daten

Bei der Vorstellung kündigte Apple für den M2 Pro eine Bandbreite von 200 GB/s und bis zu 32 GB gemeinsamen Speicher (Unified Memory) an, für den M2 Max 400 GB/s, bis zu 96 GB und eine GPU mit bis zu 38 Kernen. Apple stellte diese 96 GB als Erweiterung der Grenzen des Grafikspeichers in einem Laptop dar. Der Speicher ist mit dem Prozessor verlötet, daher wird die Konfiguration beim Kauf festgelegt und lässt sich danach nicht mehr ändern.

Die Chips der MacBook-Pro-Modelle mit 14 und 16 Zoll (2023)
ChipBandbreiteMögliche SpeicherkapazitätGPU
M2 Pro200 GB/s16 oder 32 GB16 oder 19 Kerne
M2 Max400 GB/s32, 64 oder 96 GB30 oder 38 Kerne

Die aktive Kühlung ist der zweite Vorteil gegenüber einem MacBook Air: Das MacBook Pro kann längere Belastungen bewältigen, ohne dass der Chip deutlich langsamer werden muss. Apple bietet bei einigen Modellen auch einen Hochleistungsmodus an, in dem die Lüfter schneller drehen dürfen; diese Einstellung können Sie bei längeren Generierungsvorgängen ausprobieren, allerdings auf Kosten eines höheren Geräuschpegels.

#M2 Pro oder M2 Max: Was die Bandbreite wirklich verändert

Das Mac-Kit

Lokale KI auf Ihrem Mac voll ausschöpfen: Unified Memory, MLX vs. GGUF, das passende Modell für Ihren Chip und auf Apple Silicon abgestimmte Einstellungen für Ollama und LM Studio.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Bei der Textgenerierung werden für jedes Token sämtliche aktiven Modellgewichte gelesen. Die maximale Geschwindigkeit ergibt sich daher aus der Bandbreite geteilt durch die Größe der Gewichte. Ein M2 Max mit 400 GB/s kann theoretisch doppelt so schnell sein wie ein M2 Pro mit 200 GB/s. Die im llama.cpp-Repository veröffentlichten Messungen zeigen, dass dies nur teilweise zutrifft.

Textgenerierung, Llama 7B, llama.cpp (Diskussion #4167)
Chip (GPU-Kerne)BandbreiteQ4_0Q8_0F16
M2 Pro (19)200 GB/s38,86 t/s23,01 t/s13,06 t/s
M2 Max (30)400 GB/s60,99 t/s39,97 t/s24,16 t/s
M2 Max (38)400 GB/s65,95 t/s41,83 t/s24,65 t/s

Bei einem 7B-Modell in Q4_0 erreicht der M2 Max nur das 1,6- bis 1,7-Fache der Leistung des M2 Pro. Bei demselben Modell in F16 mit etwa 13 GB steigt dieser Faktor auf fast 1,9. Die Rechnung erklärt das: Ein kleines Modell wird so schnell gelesen, dass andere begrenzende Faktoren (Rechenleistung, Latenz, Overhead) wieder den Ausschlag geben, während ein großes Modell den Speicher tatsächlich voll auslastet. Die praktische Konsequenz widerspricht der Intuition: Je größer das Modell, desto eher rechtfertigt der M2 Max seinen Preis. Für ein 7B-Modell reicht ein M2 Pro völlig aus.

→
Größenordnung für Ihr Modell
Teilen Sie die Bandbreite durch die Größe der Q4-Gewichte aus dem Katalog und ziehen Sie anschließend je nach Modellgröße 15 bis 35 % ab: Der M2 Max erreicht bei einem 7B-Modell in Q4_0 etwa 63 % des theoretischen Höchstwerts und bei einem 7B-Modell in F16 etwa 83 %. Bei einem 19-GB-Modell wie Qwen3-Coder 30B-A3B liegt der Höchstwert des M2 Max bereits bei 21 t/s, wenn alle Gewichte gelesen werden. MoE-Modelle lesen nur ihre aktiven Parameter erneut, daher ist ihr tatsächlicher Durchsatz deutlich höher.

#Von 16 bis 96 GB: Was hineinpasst und wo es knapp bleibt

Bei Apple Silicon hat die GPU standardmäßig keinen Zugriff auf den gesamten Arbeitsspeicher: Laut den Diskussionen im llama.cpp-Repository gibt Metal zwischen zwei Dritteln und drei Vierteln davon frei. Bei 16 GB können Sie mit etwa 10 bis 12 GB für das Modell und seinen Kontext rechnen, bei 96 GB mit etwa 64 bis 72 GB. Die Grenze lässt sich über eine Systemeinstellung anheben, die im zugehörigen Leitfaden ausführlich beschrieben wird. Eine Überschreitung kann jedoch dazu führen, dass der Rechner einfriert.

Modellgewichte in Q4 (QuelLLM-Katalog) nach Speicherkapazität, ohne Kontextspeicher
ModellQ4-GewichteM2 Pro 16 GBM2 Pro 32 GBM2 Max 64 GBM2 Max 96 GB
Qwen 3.5 9B6 GBKomfortabelJaJaJa
Gemma 4 12B7 GBKnappJaJaJa
Mistral Small 3.2 24B14 GBNeinJaJaJa
Qwen 3.5 27B16 GBNeinJa, mit moderater KontextlängeJaJa
Qwen3-Coder 30B-A3B (MoE)19 GBNeinJa, mit moderater KontextlängeJaJa
Qwen 3.6 35B-A3B (MoE)21 GBNeinKnappJaJa
Llama 3.3 70B40 GBNeinNeinJa, kurzer KontextJa

MoE-Modelle wie Qwen3-Coder 30B-A3B oder Qwen 3.6 35B-A3B belegen 19 bzw. 21 GB, aktivieren aber nur etwa 3 Milliarden Parameter pro Token: Bei gleicher Speicherkapazität generieren sie deutlich schneller als ein dichtes 27B-Modell. Das ist bei 32 GB die Option mit dem besten Preis-Leistungs-Verhältnis. Bei 96 GB liegt der Vorteil des M2 Max weniger darin, ein einziges sehr großes Modell zu laden, als darin, zwei Modelle gleichzeitig im Speicher zu halten, beispielsweise ein Chat-Modell und ein Code-Modell.

#Veröffentlichte Durchsatzwerte: Was sich feststellen lässt und was nicht

Wir haben keine eigenen Messungen auf diesem Rechner, und die Tokens pro Sekunde hängen vom Modell, der Quantisierung, dem Kontext und der Version von llama.cpp oder Ollama ab. Die einzigen Messungen, die wir zitieren, wurden von Nutzern mit einem Llama 7B veröffentlicht und zeigen die Größenordnung. Für ein neueres Modell bleibt die Berechnung „Bandbreite geteilt durch Modellgröße“ der richtige Ansatz, unter Berücksichtigung der oben angegebenen Fehlermarge.

Die Promptverarbeitung folgt einer anderen Logik: Die Tabelle von llama.cpp gibt für dasselbe Llama 7B in F16 bei der Promptverarbeitung 384 t/s auf einem M2 Pro mit 19 Kernen und 756 t/s auf einem M2 Max mit 38 Kernen an. Die Anzahl der GPU-Kerne beeinflusst diese Phase, nicht die Generierung. Bei RAG oder der Analyse eines langen Dokuments beträgt die Wartezeit bis zum ersten Wort auf einem M2 Max daher etwa die Hälfte der Wartezeit auf einem M2 Pro.

#Ollama auf dem Mac installieren und richtig verwenden

Ollama erfordert macOS Sonoma (14) oder neuer. Für den Mac erläutert die offizielle FAQ, dass die Umgebungsvariablen mit launchctl gesetzt werden, wenn Ollama als Anwendung läuft, und dass die Anwendung anschließend neu gestartet werden muss. Exporte in einem Terminal reichen nicht aus, da die Anwendung diese Variablen nicht sieht.

Empfehlenswerte Einstellungen für große Modelle
launchctl setenv OLLAMA_FLASH_ATTENTION 1
launchctl setenv OLLAMA_KV_CACHE_TYPE q8_0
# puis quitter et relancer l'application Ollama

Die FAQ von Ollama gibt an, dass der in q8_0 quantisierte K/V-Cache etwa halb so viel Speicher benötigt wie das standardmäßige f16-Format und dass Flash Attention aktiviert sein muss, um davon zu profitieren. Bei einem 70B-Modell mit langem Kontext sorgt diese Einstellung dafür, dass der Cache in den Speicher passt. Eine Einschränkung sollten Sie kennen: Die Quantisierung des Caches kann bei manchen Modellen die Qualität leicht verschlechtern; testen Sie sie anhand Ihrer eigenen Anwendungsfälle, bevor Sie sie beibehalten.

!
Erhöhen Sie die GPU-Speichergrenze nur, wenn Sie die Folgen kennen
Mit dem Parameter iogpu.wired_limit_mb lässt sich der GPU mehr Speicher zuweisen, aber die Einstellung bleibt nach einem Neustart nicht erhalten, und ein zu hoher Wert kann macOS einfrieren lassen. Er wird im Leitfaden zu den Apple-Silicon-Einstellungen beschrieben, der weiterhin die Referenz ist; verwenden Sie ihn nur für ein Modell, das sonst nicht in den Speicher passt, und lassen Sie dem System mindestens 8 GB.

#Welches Modell für welchen Zweck

Allgemeiner Chat
Ein Modell mit 8B bis 12B Parametern (Qwen 3.5 9B, Gemma 4 12B) antwortet auf dem M2 Pro schnell; ab 32 GB wird ein 27B-Modell für ein gepflegteres Französisch interessant.
Code
Ein Code-MoE wie Qwen3-Coder 30B-A3B mit 32 GB oder mehr, oder ein Code-Agent-Modell mit 24 Milliarden Parametern wie Devstral Small 2 (14 GB in Q4). Für die Inline-Autovervollständigung reicht ein 7B-Modell.
Dokumentbasiertes RAG
Gemma 4 12B für Geschwindigkeit, ein 24B-Modell für die Qualität des logischen Denkens; begrenzen Sie den Kontext, damit sich die Wartezeit bis zum ersten Wort nicht verlängert.
Lange Analysen, Agenten
Bei 64 GB oder mehr: Qwen 3.6 35B-A3B als schnelles MoE-Modell oder ein 70B-Modell für die Qualität, sofern Sie bestenfalls etwa 10 Tokens/s akzeptieren (400 ÷ 40).

Bei Reasoning-Modellen ist Vorsicht geboten: Sie erzeugen vor der Antwort lange Denkblöcke, wodurch sich die Anzahl der zu generierenden Tokens vervielfacht. Auf einem Rechner mit 60 Tokens/s dauern zehntausend Denktokens fast drei Minuten. Deaktivieren Sie bei einfachen Fragen den Denkmodus, wenn das Modell dies erlaubt.

#Im Akkubetrieb und unter längerer Last: Was sich ändert

Das MacBook Pro ist dafür ausgelegt, länger durchzuhalten als ein Air, bleibt aber ein Laptop. Zwei Einstellungen beeinflussen die Durchsatzraten: der Energiemodus (im Akkubetrieb kann macOS die Leistung begrenzen) und, bei Modellen, die ihn anbieten, der Hochleistungsmodus. Laut Apple können die Lüfter in diesem Modus schneller laufen, um bei sehr intensiven Arbeitslasten eine höhere Leistung aufrechtzuerhalten, allerdings mit zusätzlicher Geräuschentwicklung. Schließen Sie für eine Generierung, die mehrere Minuten dauert, das Netzteil an und probieren Sie diesen Modus aus.

#Soll man zu einem M4 Max wechseln?

Der M4 Max erreicht laut Apple 546 GB/s und 128 GB Speicher. In der llama.cpp-Tabelle steigt die Generierungsgeschwindigkeit eines Llama 7B in Q4_0 von 65,95 t/s auf einem M2 Max mit 38 Kernen auf 83,06 t/s auf einem M4 Max mit 40 Kernen: etwa 26 % mehr. Der Leistungsgewinn macht sich bei intensiver Nutzung bemerkbar, aber der M2 Max mit 96 GB behält einen Vorteil bei der Speicherkapazität gegenüber einem M4 Pro, der auf 64 GB begrenzt ist.

Wann Sie Ihren M2 Max behalten sollten und wann ein Wechsel sinnvoll ist
SituationEmpfehlung
Sie verwenden hauptsächlich 8–14B-ModelleEin M2 Pro mit 32 GB reicht aus; zahlen Sie nicht für zusätzliche Bandbreite.
Sie laden täglich Modelle mit 27 bis 35 Milliarden ParameternM2 Max mit 64 oder 96 GB: Hier lohnt er sich
Sie möchten ein 70B-Modell komfortabel betreiben oder zwei Modelle gleichzeitig im Speicher haltenM2 Max 96 GB oder M4 Max 128 GB, falls Geschwindigkeit von Bedeutung ist
Sie suchen einen Server ohne BildschirmEin Mac mini M4 Pro oder ein Mac Studio ist besser geeignet

#Häufig gestellte Fragen

FAQ
Ist ein MacBook Pro mit M2 Pro und 16 GB für lokale KI ausreichend?+
Ja, für Modelle mit 8 bis 9 Milliarden Parametern in Q4, die 5 bis 6 GB belegen, bei einer angemessenen Kontextlänge. Für Modelle mit 24 Milliarden Parametern und mehr eignet sich das Gerät nicht. Da sich der Arbeitsspeicher nicht nachträglich erweitern lässt, wählen Sie 32 GB, wenn Sie eines Tages zu einem größeren Modell wechseln möchten.
Was ist der Unterschied zwischen dem M2 Max mit 30 und mit 38 GPU-Kernen?+
Beide haben eine Bandbreite von 400 GB/s. Bei den Messungen von llama.cpp ist die Textgenerierung nur etwa 8 % schneller bei 38 Kernen (65,95 gegenüber 60,99 t/s bei Q4_0), da sie von der Bandbreite abhängt. Der Unterschied ist bei der Promptverarbeitung deutlicher, wobei die Version mit 38 Kernen deutlich schneller ist.
Kann man zwei LLM gleichzeitig auf einem M2 Max 64 GB laufen lassen?+
Ja, wenn der gesamte Speicherbedarf der Gewichte und Kontexte innerhalb des Speicheranteils bleibt, den Metal der GPU zuweist, also etwa 43 bis 48 GB. Beispielsweise passen ein 27B-Modell (16 GB) und ein 12B-Modell (7 GB) zusammen hinein. Ollama hält Modelle standardmäßig 5 Minuten im Speicher, und das erneute Laden dauert einige Sekunden.
Welches Modell für Französisch auf einem MacBook Pro M2 Max?+
Mistral Small 3.2 24B vom französischen KI-Labor Mistral AI ist bei 32 GB Speicher und mehr ein guter Kandidat (14 GB in Q4). Qwen 3.5 9B und Gemma 4 12B sind mehrsprachig und schneller. Testen Sie sie mit Ihren eigenen Texten: Die Qualität auf Französisch hängt von der Art der Aufgabe ab.
Wird der M2 Max bei der Inferenz heißer als der M1 Max?+
Wir können keinen verlässlichen Vergleich mit konkreten Zahlen anführen. Beide verfügen über eine aktive Kühlung; die Geschwindigkeit hängt vor allem von der Bandbreite ab, die mit 400 GB/s identisch ist. Schließen Sie für lange Textgenerierungen das Netzteil an und probieren Sie den von Apple angebotenen Hochleistungsmodus aus, wobei Sie die Lüftergeräusche in Kauf nehmen müssen.
Muss MLX neben Ollama auf einem M2 Max installiert werden?+
Nicht unbedingt. Ollama reicht für Chat, RAG und API aus. MLX ist für Entwickler interessant, die das Modell aus Python steuern oder lokales LoRA-Finetuning testen möchten. Die Geschwindigkeitsunterschiede variieren je nach Modell und Version: Der ausführliche Vergleich auf dieser Website untersucht sie, ohne einen festen Geschwindigkeitsgewinn zu versprechen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.