Mittelstufe 15 minMac

Mac M4 Max und lokale LLMs: MLX, Leistung, Modelle

Das MacBook Pro M4 Max (64 oder 128 GB gemeinsamer Arbeitsspeicher) ist zum leistungsfähigsten tragbaren Rechner für den Betrieb eines lokalen LLM geworden. Die Kombination aus gemeinsamem Arbeitsspeicher und Apples MLX-Framework ermöglicht es, die derzeit größten Open-Weight-Modelle – MoE-Modelle mit 30–35 Milliarden Parametern in voller Präzision und dichte multimodale Modelle mit 27 Milliarden Parametern – auf einem Laptop zu laden und mit überraschenden Geschwindigkeiten auszuführen. Dieser Leitfaden misst, was wirklich funktioniert: MLX vs. Ollama, konkret nutzbare Modelle, gemessene Tokens pro Sekunde und das Temperaturverhalten im Akkubetrieb.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Kaufalternative für diesen Guide: Mac Studio M5 Max (36 GB / 512 GB).

Warum diese Wahl? Unsere vollständige Übersicht zu Mac Studio M5 Max (36 GB / 512 GB) →

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.

#Warum der M4 Max die Situation für lokale LLMs verändert

Auf einem Windows- oder Linux-PC ist der VRAM der GPU die wichtigste Einschränkung. Eine RTX 4090 ist auf 24 GB begrenzt: Um ein Modell mit 30–35 Milliarden Parametern lokal in FP16 auszuführen, ist CPU-Offloading erforderlich, wodurch der Durchsatz auf ein Fünftel oder ein Zehntel sinkt. Der M4 Max geht das Problem von der anderen Seite an. GPU und CPU teilen sich denselben Speicher: Alles, was im RAM liegt, ist für die GPU ohne Kopieren zugänglich.

Konkret kann ein MacBook Pro M4 Max mit 128 GB die besten MoE-Modelle des Jahres 2026 – Qwen 3.6 35B-A3B oder Qwen 3.8 27B – problemlos mit voller FP16-Präzision oder mehrere Modelle gleichzeitig laden und sie auch im Akkubetrieb weiter ausführen. Kein tragbarer x86-Rechner kann das heute – dafür braucht es einen Desktop mit einer RTX 5090 oder zwei RTX 3090, um annähernd dasselbe Ergebnis zu erzielen, und selbst dann geht es nicht unterwegs.

i
Was "M4 Max" bedeutet
Der M4 Max ist die Hochleistungschipvariante der MacBook Pro 14" und 16" aus Ende 2024. Er ist in zwei GPU-Konfigurationen (32 oder 40 Kerne) und drei RAM-Ebenen verfügbar: 36, 48, 64 oder 128 GB. Für die LLM-Inferenz sind nur die Versionen mit 64 und 128 GB sinnvoll. Die angekündigte Speichergeschwindigkeit beträgt 546 GB/s.

#Unified RAM: Warum 128 GB ≠ 128 GB VRAM

Das Mac-Kit

Sie haben gesehen, was ein M4 Max mit MLX leistet. Das Mac-Kit erläutert, wann MLX GGUF wirklich übertrifft (Kap. 3), wie Sie Ihr Speicherbudget für lange Kontexte berechnen (Kap. 5) und welche Leistung Sie erwarten können, einschließlich Wärmeentwicklung und Akkulaufzeit (Kap. 6).

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

macOS lässt nicht zu, dass ein einzelner Prozess den gesamten Arbeitsspeicher verbraucht. Standardmäßig kann die GPU etwa 75 % des gesamten RAM nutzen. Auf einem Rechner mit 128 GB stehen damit etwa 96 GB für Ihre Modelle zur Verfügung. Bei 64 GB sind es etwa 48 GB. Das reicht für die vorgesehenen Modelle mehr als aus, sollte aber vor der Berechnung berücksichtigt werden.

Mac M4 Max 64 GB
Etwa 48 GB für das LLM. Die besten MoE-Modelle von 2026 lassen sich in Q8 komfortabel nutzen – Qwen3-Coder 30B-A3B (≈32 GB), Qwen 3.8 27B (≈30 GB), Qwen 3.6 35B-A3B (≈40 GB), das gerade noch hineinpasst – und Mistral Small 24B passt sogar in FP16 (≈48 GB) in den Speicher.
Mac M4 Max 128 GB
Etwa 96 GB für das LLM. Genug Spielraum, um große MoE-Modelle mit voller FP16-Präzision auszuführen (Qwen 3.6 35B-A3B, Qwen 3.8 27B, Granite 4.2 30B), mehrere Modelle gleichzeitig geladen zu halten oder den Kontext auf 256k Tokens zu erweitern.
Empfohlene Quantisierungen
Q4_K_M bleibt eine gute Standardeinstellung. Mit 128 GB können Sie problemlos auf Q5_K_M oder Q6 wechseln, um die Qualität zu verbessern.
Den der GPU zugewiesenen Speicher erhöhen (optional)
# Par défaut macOS laisse ~75% de la RAM au GPU.
# Pour pousser à ~85% (à vos risques, peut faire swapper le système) :
sudo sysctl iogpu.wired_limit_mb=110000

# Pour revenir à la valeur par défaut :
sudo sysctl iogpu.wired_limit_mb=0
!
Setzen Sie das Limit nicht höher als 90 %
Wird die Grenze zu hoch gesetzt, bleibt macOS selbst zu wenig Speicher. Ab 90 % riskieren Sie ein Einfrieren des Systems und permanentes Swapping. Der Standardwert eignet sich für 95 % der Anwendungsfälle.

#MLX vs. Ollama: Was eignet sich für einen Mac M4 Max?

Apple veröffentlichte MLX im Dezember 2023: ein für Apple Silicon entwickeltes Framework für Array-Berechnungen, funktional vergleichbar mit PyTorch, aber auf einheitlichen Speicher ausgelegt. Das Modul mlx-lm stellt eine CLI und eine Python-API bereit, um quantisierte Modelle im MLX-Format auszuführen (ähnlich wie GGUF, aber ein eigenständiges Format).

Ollama (Metal)
Einfacher zu installieren, riesiges Ökosystem, universelle GGUF-Formate, OpenAI-kompatible API auf :11434. Geringer Overhead, nicht optimale Speicherumwandlung zwischen CPU und GPU.
MLX (mlx-lm)
In der Praxis schneller auf Apple Silicon: 20 bis 40 % mehr Tokens pro Sekunde bei Modellen ab 30B, native Speicherverwaltung, integriertes Prompt-Caching. Kleineres Ökosystem, keine standardisierte REST-API von Haus aus.
Fazit
Um 10 Modelle zu erkunden und auszuprobieren: Ollama. Um den M4 Max voll auszureizen und große MoE-Modelle mit 30 bis 35 Milliarden Parametern mit voller Präzision im lokalen Produktivbetrieb zu betreiben: MLX.
→
Beide lassen sich sehr gut nebeneinander nutzen
Viele Nutzer eines M4 Max lassen Ollama als dauerhaften Server für Drittanbieter-Apps (Open WebUI, n8n, Continue.dev) laufen und starten MLX gelegentlich für Sitzungen, in denen sie möglichst viele Tokens pro Sekunde erzielen möchten.

#MLX installieren und ein erstes Modell ausführen

  1. 01
    Eine Python-Umgebung vorbereiten
    Verwenden Sie Python 3.10+ (3.12 empfohlen). Auf Mac ist uv oder pyenv die sauberste Lösung. mlx-lm hat keine nativen Voraussetzungen außer Apple Silicon.
  2. 02
    mlx-lm installieren
    Ein einziger pip-Befehl reicht aus. Alles ist für arm64 Metal kompiliert.
  3. 03
    Ein MLX-Modell starten
    Der Befehl mlx_lm.generate lädt das Modell von Hugging Face (Organisation mlx-community) herunter und führt es aus.
  4. 04
    Eine HTTP-API bereitstellen (optional)
    mlx-lm enthält seit Version 0.18 den Befehl mlx_lm.server, der eine OpenAI-kompatible API auf dem Port 8080 verfügbar macht.
Terminal — Installation und erster Test
# 1. Environnement
python3 -m venv ~/mlx-env
source ~/mlx-env/bin/activate

# 2. Installation
pip install --upgrade mlx-lm

# 3. Téléchargement + génération en une commande
mlx_lm.generate \
  --model mlx-community/Qwen3.6-35B-A3B-Instruct-4bit \
  --prompt "Explique en français le principe de la mémoire unifiée Apple Silicon." \
  --max-tokens 512
OpenAI-kompatibler MLX-Server
# Démarre une API sur http://localhost:8080/v1
mlx_lm.server \
  --model mlx-community/Qwen3.8-27B-Instruct-4bit \
  --port 8080

#Auf einem MacBook Pro M4 Max mit 128 GB getestete Modelle

Alle folgenden Zahlen wurden auf einem MacBook Pro 16" M4 Max (40 GPU-Kerne, 128 GB) gemessen, am Stromnetz angeschlossen, zunächst im kalten Zustand und dann nach 5 Minuten Aufwärmphase. Kurzer Prompt (50 Tokens), Generierung von 500 Tokens, Batchgröße 1.

Qwen 3.6 35B-A3B Q8 (MLX)
≈40 GB im RAM. 42–50 Tokens/s: Das MoE-Modell aktiviert nur 3 Milliarden Parameter, daher der hohe Durchsatz trotz seiner Größe. Eine bewährte, vielseitige Wahl für diesen Mac.
Qwen 3.8 27B Q8 (MLX)
≈30 GB im RAM. 18–22 Tokens/s (dichtes Modell). 262k Kontext und Bildverarbeitung; kommt einem lokalen Copilot am nächsten. Denken Sie daran, die Einstellung für das Reasoning auf low zu setzen, sonst denkt das Modell zu viel nach.
Qwen3-Coder 30B-A3B Q8 (MLX)
≈32 GB RAM. 44–52 Tokens/s. Spezialisiertes MoE für Code, 256k Kontext: ideal als lokaler Entwicklungsassistent.
GLM 4.7 Flash Q8 (MLX)
≈32 GB RAM (MoE 30B-A3B, MIT-Lizenz). 40–48 Tokens pro Sekunde. Hervorragend für Agenten und Tool-Aufrufe, reagiert sehr schnell.
Granite 4.2 30B Q8 (MLX)
≈33 GB im RAM. 30–38 Tokens/s. Auf den professionellen Einsatz und die Nutzung in Unternehmen ausgerichtet, sparsam im Tokenverbrauch und bei langen Sitzungen stabil.
Mistral Small 24B FP16 (MLX)
≈48 GB. 18–22 Tokens/s. Dichtes Modell, hervorragende Qualität auf Französisch, besonders gut beim Zusammenfassen von Dokumenten.

#Detaillierte Benchmarktests: MLX vs Ollama vs llama.cpp

Beim selben Modell Qwen 3.8 27B in Q8 wurde zwischen den drei Runtimes auf demselben Rechner mit M4 Max und 128 GB folgende Streuung beobachtet:

MLX 8-bit (mlx-community)
Durchschnittlich 20,5 Tokens/s, Prompt-Verarbeitung ca. 410 Tokens/s.
Ollama Q8_0 (Metal)
Durchschnittlich 15,2 Tokens pro Sekunde, Prompt-Bewertung ~300 Tokens pro Sekunde.
llama.cpp pur Q8_0
Durchschnittlich 15,6 Tokens pro Sekunde. Ollama verursacht gegenüber llama.cpp nur wenig Overhead.
i
Warum MLX gewinnt
MLX vermeidet die Umwandlung zwischen CPU- und GPU-Darstellungen und nutzt die Metal-Performance-Shaders-Instruktionen für quantisierte Matrixmultiplikationen besser aus. Der Unterschied wächst mit zunehmender Modellgröße: Bei 7B ist er marginal, bei großen Modellen ab 30B wird er deutlich.

#M4 Max vs. RTX 4090: Wer gewinnt wobei?

Der direkte Vergleich: ein MacBook Pro M4 Max mit 128 GB (bei Apple durch das M5-Max-Modell ersetzt – gebraucht zu suchen, Preis variabel) gegenüber einem Desktop-PC mit einer gebrauchten RTX 4090 mit 24 GB (Preis variabel, nur die GPU, ohne den Rest des PCs).

Kleine Modelle ≤14B Q4 (Qwen 3.5 9B, gpt-oss 20B)
RTX 4090 gewinnt deutlich (80–120 Tok/s gegenüber 35–60 auf M4 Max). Für diese Größen sollten Sie die 4090 wählen, wenn Sie die Wahl haben.
Dichte Modelle 24-30B Q4 (Mistral Small, Qwen 3.8 27B)
RTX 4090 liegt weiter vorne (30–40 Tok/s gegenüber 18–22 auf M4 Max), aber der Unterschied schrumpft.
Volle Präzision Q8/FP16
Der M4 Max liegt in der Praxis vorn: Er kann die besten MoE-Modelle von 2026 (35B-A3B, 27B) in Q8 oder FP16 in seinem RAM ausführen, während die RTX 4090 auf Q4 zurückgehen oder auf die CPU auslagern muss (der Durchsatz sinkt auf ein Fünftel).
Großes MoE-Modell (Qwen 3.6 35B-A3B)
Der M4 Max ist dank seines großen Arbeitsspeichers hervorragend: Alles passt in den Speicher, selbst in FP16. Die RTX 4090 muss Daten in den Arbeitsspeicher auslagern, sobald die Präzision über Q4 hinausgeht.
Mobilität
Kein Vergleich: Der M4 Max hält im Akkubetrieb etwa 3 Stunden kontinuierlicher Inferenz durch, die RTX 4090 schafft 0 km.
→
Die Entscheidungsgrenze
Sie möchten die besten MoE-Modelle des Jahres 2026 in voller Präzision (Q8/FP16) ausführen und mehrere davon gleichzeitig geladen halten? Der M4 Max mit 128 GB bietet unter den tragbaren Rechnern auf dem Markt das beste Preis-Leistungs-Verhältnis. Sie wollen ein sehr schnelles 13B-Modell betreiben? Eine Desktop-RTX 4090 kostet halb so viel und ist doppelt so schnell.

#Wärmeentwicklung, Lüfter und Akkulaufzeit

Der M4 Max wird bei der Inferenz im Vergleich zu einem NVIDIA-GPU wenig warm. Unter Dauerlast (5 Minuten Generierung auf einem großen MoE 35B in Q8) steigen die Lüfter auf etwa 2 800 U/min – hörbar, aber weit von der Belästigung eines Gaming-PCs entfernt. Die CPU/GPU-Temperatur bleibt bei etwa 95 °C ohne nennenswerte Drosselung im Netzbetrieb.

Im Netzbetrieb (140-W-Ladegerät)
Volle Leistung, maximaler Durchsatz. Keine Einschränkungen, Lüfter mit moderater Drehzahl.
Im Akkubetrieb
macOS senkt den GPU-Takt leicht: etwa 80 % des Durchsatzes im Netzbetrieb. Bei Qwen 3.6 35B-A3B sinkt die Geschwindigkeit von etwa 45 auf 37 Tokens/s.
Batterielaufzeit für Inferenz
MacBook Pro 16" M4 Max mit 100 Wh: ~3 h kontinuierliche Inferenz mit einem großen 35B-MoE, ~5 h mit 7B–14B-Modellen, ~8 h bei gemischter Nutzung mit Chat und Lesen.
Lüftergeräusche
Ab 30 Sekunden kontinuierlicher Generierung hörbar, aber deutlich leiser als ein PC-Laptop mit RTX.

#Tipps, um das Maximum aus dem M4 Max herauszuholen

Lassen Sie das Modell geladen
Der erste Prompt nach dem Laden ist langsam. Verwenden Sie den Servermodus (mlx_lm.server oder ollama serve), um das Modell während der gesamten Sitzung im RAM zu halten.
Bevorzugen Sie das MLX-Format
Die von mlx-community auf Hugging Face veröffentlichten Modelle sind für Apple Silicon optimiert. Suchen Sie zuerst nach dem Präfix "mlx-community/", bevor Sie nach anderen Präfixen suchen.
Überwachen Sie mit asitop oder Stats
asitop (das Pendant zu nvtop für Apple Silicon) zeigt den GPU-Verbrauch, die Speichernutzung und die momentane Leistungsaufnahme in Echtzeit an.
Hochleistungsmodus
In Systemeinstellungen → Batterie → „Hohe Leistung“ auswählen. Geringer, aber tatsächlicher Leistungsgewinn bei 70B-Modellen.
Deaktivieren Sie Spotlight während der Benchmarktests
Die Spotlight-Indexierung kann den Durchsatz um 5 bis 10 % verringern. mdutil -a -i off deaktiviert sie für die Dauer einer Sitzung.
asitop installieren, um die GPU zu überwachen
# Installation
pip install asitop

# Lancement (nécessite sudo pour lire les compteurs hardware)
sudo asitop
!
Kein CUDA = kein ernsthaftes Fine-Tuning
MLX ermöglicht grundlegendes LoRA-Fine-Tuning, aber das Ökosystem bleibt deutlich hinter PyTorch + CUDA zurück. Für intensives Fine-Tuning ist ein Mac M4 Max keine geeignete Maschine – bevorzugen Sie eine RTX 3090/4090 oder einen Cloud-Dienst mit H100.

#Weiterführende Informationen

Drei Ansätze, um das Thema zu vertiefen:

Ollama auf macOS installieren
Wenn Sie Einfachheit vor reine Leistung stellen, deckt der Leitfaden "Ollama auf macOS (Apple Silicon) installieren" sämtliche Metal-Werkzeuge auf Ollama-Seite ab.
Quantisierung wählen
Mit 128 GB vereinheitlichtem Arbeitsspeicher haben Sie genügend Spielraum, um auf Q5_K_M, Q6 oder sogar FP16 umzusteigen — der Leitfaden „Quantisierung wählen“ erläutert die Abwägungen.
Mac Studio Ultra für weitere Möglichkeiten
Wenn Ihnen die MoE-Modelle mit 30–35B nicht ausreichen und Sie die größten Open-Weight-Modelle (100B bis 671B) lokal nutzen möchten, behandelt der Leitfaden „Welches LLM auf dem Mac Studio?“ die Ultra-Konfigurationen mit bis zu 512 GB.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.