Mac M4 Max und lokale LLMs: MLX, Leistung, Modelle
Das MacBook Pro M4 Max (64 oder 128 GB gemeinsamer Arbeitsspeicher) ist zum leistungsfähigsten tragbaren Rechner für den Betrieb eines lokalen LLM geworden. Die Kombination aus gemeinsamem Arbeitsspeicher und Apples MLX-Framework ermöglicht es, die derzeit größten Open-Weight-Modelle – MoE-Modelle mit 30–35 Milliarden Parametern in voller Präzision und dichte multimodale Modelle mit 27 Milliarden Parametern – auf einem Laptop zu laden und mit überraschenden Geschwindigkeiten auszuführen. Dieser Leitfaden misst, was wirklich funktioniert: MLX vs. Ollama, konkret nutzbare Modelle, gemessene Tokens pro Sekunde und das Temperaturverhalten im Akkubetrieb.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: Mac Studio M5 Max (36 GB / 512 GB).
Warum diese Wahl? Unsere vollständige Übersicht zu Mac Studio M5 Max (36 GB / 512 GB) →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.
#Warum der M4 Max die Situation für lokale LLMs verändert
Auf einem Windows- oder Linux-PC ist der VRAM der GPU die wichtigste Einschränkung. Eine RTX 4090 ist auf 24 GB begrenzt: Um ein Modell mit 30–35 Milliarden Parametern lokal in FP16 auszuführen, ist CPU-Offloading erforderlich, wodurch der Durchsatz auf ein Fünftel oder ein Zehntel sinkt. Der M4 Max geht das Problem von der anderen Seite an. GPU und CPU teilen sich denselben Speicher: Alles, was im RAM liegt, ist für die GPU ohne Kopieren zugänglich.
Konkret kann ein MacBook Pro M4 Max mit 128 GB die besten MoE-Modelle des Jahres 2026 – Qwen 3.6 35B-A3B oder Qwen 3.8 27B – problemlos mit voller FP16-Präzision oder mehrere Modelle gleichzeitig laden und sie auch im Akkubetrieb weiter ausführen. Kein tragbarer x86-Rechner kann das heute – dafür braucht es einen Desktop mit einer RTX 5090 oder zwei RTX 3090, um annähernd dasselbe Ergebnis zu erzielen, und selbst dann geht es nicht unterwegs.
#Unified RAM: Warum 128 GB ≠ 128 GB VRAM
Sie haben gesehen, was ein M4 Max mit MLX leistet. Das Mac-Kit erläutert, wann MLX GGUF wirklich übertrifft (Kap. 3), wie Sie Ihr Speicherbudget für lange Kontexte berechnen (Kap. 5) und welche Leistung Sie erwarten können, einschließlich Wärmeentwicklung und Akkulaufzeit (Kap. 6).
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
macOS lässt nicht zu, dass ein einzelner Prozess den gesamten Arbeitsspeicher verbraucht. Standardmäßig kann die GPU etwa 75 % des gesamten RAM nutzen. Auf einem Rechner mit 128 GB stehen damit etwa 96 GB für Ihre Modelle zur Verfügung. Bei 64 GB sind es etwa 48 GB. Das reicht für die vorgesehenen Modelle mehr als aus, sollte aber vor der Berechnung berücksichtigt werden.
- Mac M4 Max 64 GB
- Etwa 48 GB für das LLM. Die besten MoE-Modelle von 2026 lassen sich in Q8 komfortabel nutzen – Qwen3-Coder 30B-A3B (≈32 GB), Qwen 3.8 27B (≈30 GB), Qwen 3.6 35B-A3B (≈40 GB), das gerade noch hineinpasst – und Mistral Small 24B passt sogar in FP16 (≈48 GB) in den Speicher.
- Mac M4 Max 128 GB
- Etwa 96 GB für das LLM. Genug Spielraum, um große MoE-Modelle mit voller FP16-Präzision auszuführen (Qwen 3.6 35B-A3B, Qwen 3.8 27B, Granite 4.2 30B), mehrere Modelle gleichzeitig geladen zu halten oder den Kontext auf 256k Tokens zu erweitern.
- Empfohlene Quantisierungen
- Q4_K_M bleibt eine gute Standardeinstellung. Mit 128 GB können Sie problemlos auf Q5_K_M oder Q6 wechseln, um die Qualität zu verbessern.
#MLX vs. Ollama: Was eignet sich für einen Mac M4 Max?
Apple veröffentlichte MLX im Dezember 2023: ein für Apple Silicon entwickeltes Framework für Array-Berechnungen, funktional vergleichbar mit PyTorch, aber auf einheitlichen Speicher ausgelegt. Das Modul mlx-lm stellt eine CLI und eine Python-API bereit, um quantisierte Modelle im MLX-Format auszuführen (ähnlich wie GGUF, aber ein eigenständiges Format).
- Ollama (Metal)
- Einfacher zu installieren, riesiges Ökosystem, universelle GGUF-Formate, OpenAI-kompatible API auf :11434. Geringer Overhead, nicht optimale Speicherumwandlung zwischen CPU und GPU.
- MLX (mlx-lm)
- In der Praxis schneller auf Apple Silicon: 20 bis 40 % mehr Tokens pro Sekunde bei Modellen ab 30B, native Speicherverwaltung, integriertes Prompt-Caching. Kleineres Ökosystem, keine standardisierte REST-API von Haus aus.
- Fazit
- Um 10 Modelle zu erkunden und auszuprobieren: Ollama. Um den M4 Max voll auszureizen und große MoE-Modelle mit 30 bis 35 Milliarden Parametern mit voller Präzision im lokalen Produktivbetrieb zu betreiben: MLX.
#MLX installieren und ein erstes Modell ausführen
- 01Eine Python-Umgebung vorbereitenVerwenden Sie Python 3.10+ (3.12 empfohlen). Auf Mac ist uv oder pyenv die sauberste Lösung. mlx-lm hat keine nativen Voraussetzungen außer Apple Silicon.
- 02mlx-lm installierenEin einziger pip-Befehl reicht aus. Alles ist für arm64 Metal kompiliert.
- 03Ein MLX-Modell startenDer Befehl mlx_lm.generate lädt das Modell von Hugging Face (Organisation mlx-community) herunter und führt es aus.
- 04Eine HTTP-API bereitstellen (optional)mlx-lm enthält seit Version 0.18 den Befehl mlx_lm.server, der eine OpenAI-kompatible API auf dem Port 8080 verfügbar macht.
#Auf einem MacBook Pro M4 Max mit 128 GB getestete Modelle
Alle folgenden Zahlen wurden auf einem MacBook Pro 16" M4 Max (40 GPU-Kerne, 128 GB) gemessen, am Stromnetz angeschlossen, zunächst im kalten Zustand und dann nach 5 Minuten Aufwärmphase. Kurzer Prompt (50 Tokens), Generierung von 500 Tokens, Batchgröße 1.
- Qwen 3.6 35B-A3B Q8 (MLX)
- ≈40 GB im RAM. 42–50 Tokens/s: Das MoE-Modell aktiviert nur 3 Milliarden Parameter, daher der hohe Durchsatz trotz seiner Größe. Eine bewährte, vielseitige Wahl für diesen Mac.
- Qwen 3.8 27B Q8 (MLX)
- ≈30 GB im RAM. 18–22 Tokens/s (dichtes Modell). 262k Kontext und Bildverarbeitung; kommt einem lokalen Copilot am nächsten. Denken Sie daran, die Einstellung für das Reasoning auf low zu setzen, sonst denkt das Modell zu viel nach.
- Qwen3-Coder 30B-A3B Q8 (MLX)
- ≈32 GB RAM. 44–52 Tokens/s. Spezialisiertes MoE für Code, 256k Kontext: ideal als lokaler Entwicklungsassistent.
- GLM 4.7 Flash Q8 (MLX)
- ≈32 GB RAM (MoE 30B-A3B, MIT-Lizenz). 40–48 Tokens pro Sekunde. Hervorragend für Agenten und Tool-Aufrufe, reagiert sehr schnell.
- Granite 4.2 30B Q8 (MLX)
- ≈33 GB im RAM. 30–38 Tokens/s. Auf den professionellen Einsatz und die Nutzung in Unternehmen ausgerichtet, sparsam im Tokenverbrauch und bei langen Sitzungen stabil.
- Mistral Small 24B FP16 (MLX)
- ≈48 GB. 18–22 Tokens/s. Dichtes Modell, hervorragende Qualität auf Französisch, besonders gut beim Zusammenfassen von Dokumenten.
#Detaillierte Benchmarktests: MLX vs Ollama vs llama.cpp
Beim selben Modell Qwen 3.8 27B in Q8 wurde zwischen den drei Runtimes auf demselben Rechner mit M4 Max und 128 GB folgende Streuung beobachtet:
- MLX 8-bit (mlx-community)
- Durchschnittlich 20,5 Tokens/s, Prompt-Verarbeitung ca. 410 Tokens/s.
- Ollama Q8_0 (Metal)
- Durchschnittlich 15,2 Tokens pro Sekunde, Prompt-Bewertung ~300 Tokens pro Sekunde.
- llama.cpp pur Q8_0
- Durchschnittlich 15,6 Tokens pro Sekunde. Ollama verursacht gegenüber llama.cpp nur wenig Overhead.
#M4 Max vs. RTX 4090: Wer gewinnt wobei?
Der direkte Vergleich: ein MacBook Pro M4 Max mit 128 GB (bei Apple durch das M5-Max-Modell ersetzt – gebraucht zu suchen, Preis variabel) gegenüber einem Desktop-PC mit einer gebrauchten RTX 4090 mit 24 GB (Preis variabel, nur die GPU, ohne den Rest des PCs).
- Kleine Modelle ≤14B Q4 (Qwen 3.5 9B, gpt-oss 20B)
- RTX 4090 gewinnt deutlich (80–120 Tok/s gegenüber 35–60 auf M4 Max). Für diese Größen sollten Sie die 4090 wählen, wenn Sie die Wahl haben.
- Dichte Modelle 24-30B Q4 (Mistral Small, Qwen 3.8 27B)
- RTX 4090 liegt weiter vorne (30–40 Tok/s gegenüber 18–22 auf M4 Max), aber der Unterschied schrumpft.
- Volle Präzision Q8/FP16
- Der M4 Max liegt in der Praxis vorn: Er kann die besten MoE-Modelle von 2026 (35B-A3B, 27B) in Q8 oder FP16 in seinem RAM ausführen, während die RTX 4090 auf Q4 zurückgehen oder auf die CPU auslagern muss (der Durchsatz sinkt auf ein Fünftel).
- Großes MoE-Modell (Qwen 3.6 35B-A3B)
- Der M4 Max ist dank seines großen Arbeitsspeichers hervorragend: Alles passt in den Speicher, selbst in FP16. Die RTX 4090 muss Daten in den Arbeitsspeicher auslagern, sobald die Präzision über Q4 hinausgeht.
- Mobilität
- Kein Vergleich: Der M4 Max hält im Akkubetrieb etwa 3 Stunden kontinuierlicher Inferenz durch, die RTX 4090 schafft 0 km.
#Wärmeentwicklung, Lüfter und Akkulaufzeit
Der M4 Max wird bei der Inferenz im Vergleich zu einem NVIDIA-GPU wenig warm. Unter Dauerlast (5 Minuten Generierung auf einem großen MoE 35B in Q8) steigen die Lüfter auf etwa 2 800 U/min – hörbar, aber weit von der Belästigung eines Gaming-PCs entfernt. Die CPU/GPU-Temperatur bleibt bei etwa 95 °C ohne nennenswerte Drosselung im Netzbetrieb.
- Im Netzbetrieb (140-W-Ladegerät)
- Volle Leistung, maximaler Durchsatz. Keine Einschränkungen, Lüfter mit moderater Drehzahl.
- Im Akkubetrieb
- macOS senkt den GPU-Takt leicht: etwa 80 % des Durchsatzes im Netzbetrieb. Bei Qwen 3.6 35B-A3B sinkt die Geschwindigkeit von etwa 45 auf 37 Tokens/s.
- Batterielaufzeit für Inferenz
- MacBook Pro 16" M4 Max mit 100 Wh: ~3 h kontinuierliche Inferenz mit einem großen 35B-MoE, ~5 h mit 7B–14B-Modellen, ~8 h bei gemischter Nutzung mit Chat und Lesen.
- Lüftergeräusche
- Ab 30 Sekunden kontinuierlicher Generierung hörbar, aber deutlich leiser als ein PC-Laptop mit RTX.
#Tipps, um das Maximum aus dem M4 Max herauszuholen
- Lassen Sie das Modell geladen
- Der erste Prompt nach dem Laden ist langsam. Verwenden Sie den Servermodus (mlx_lm.server oder ollama serve), um das Modell während der gesamten Sitzung im RAM zu halten.
- Bevorzugen Sie das MLX-Format
- Die von mlx-community auf Hugging Face veröffentlichten Modelle sind für Apple Silicon optimiert. Suchen Sie zuerst nach dem Präfix "mlx-community/", bevor Sie nach anderen Präfixen suchen.
- Überwachen Sie mit asitop oder Stats
- asitop (das Pendant zu nvtop für Apple Silicon) zeigt den GPU-Verbrauch, die Speichernutzung und die momentane Leistungsaufnahme in Echtzeit an.
- Hochleistungsmodus
- In Systemeinstellungen → Batterie → „Hohe Leistung“ auswählen. Geringer, aber tatsächlicher Leistungsgewinn bei 70B-Modellen.
- Deaktivieren Sie Spotlight während der Benchmarktests
- Die Spotlight-Indexierung kann den Durchsatz um 5 bis 10 % verringern. mdutil -a -i off deaktiviert sie für die Dauer einer Sitzung.
#Weiterführende Informationen
Drei Ansätze, um das Thema zu vertiefen:
- Ollama auf macOS installieren
- Wenn Sie Einfachheit vor reine Leistung stellen, deckt der Leitfaden "Ollama auf macOS (Apple Silicon) installieren" sämtliche Metal-Werkzeuge auf Ollama-Seite ab.
- Quantisierung wählen
- Mit 128 GB vereinheitlichtem Arbeitsspeicher haben Sie genügend Spielraum, um auf Q5_K_M, Q6 oder sogar FP16 umzusteigen — der Leitfaden „Quantisierung wählen“ erläutert die Abwägungen.
- Mac Studio Ultra für weitere Möglichkeiten
- Wenn Ihnen die MoE-Modelle mit 30–35B nicht ausreichen und Sie die größten Open-Weight-Modelle (100B bis 671B) lokal nutzen möchten, behandelt der Leitfaden „Welches LLM auf dem Mac Studio?“ die Ultra-Konfigurationen mit bis zu 512 GB.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.