Mittelstufe 11 Min.Apple

Lokales LLM auf dem Mac M5: MLX übertrifft llama.cpp inzwischen deutlich (Zahlen 2026)

Auf dem Mac M5 ist die Debatte zwischen MLX und llama.cpp entschieden: Bei identischem Modell und identischer Quantisierung liefert Apples Framework mittlerweile 30 bis 40 % mehr Tokens pro Sekunde. Dieser Leitfaden beziffert den Unterschied auf M5 und M5 Max, erklärt die neue MLX-Engine von Ollama, die im Juni 2026 eingeführt wurde, und zeigt, wie weit sich das ausreizen lässt – auch durch die Verbindung zweier Rechner über Thunderbolt 5, um Modelle mit 120B+ auszuführen. Er ergänzt den Leitfaden zum MacBook Pro M4 Max um den M5: dieselben Prinzipien, aktualisierte Zahlen.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-08-30·Getestet auf macOS 14+
Empfohlene Hardware

Für diese Konfiguration: Mac mini M5 Pro (24 GB / 512 GB).

Warum diese Wahl? Unsere vollständige Übersicht zu Mac mini M5 Pro (24 GB / 512 GB) →

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.

#Warum der M5 die Möglichkeiten für ein lokales LLM auf dem Mac grundlegend verändert

Der M5-Chip bringt zwei Dinge mit, die für die Inferenz wirklich zählen: GPU-Kerne mit Einheiten zur Matrixmultiplikation (Neural Accelerators), die in jeden Kern integriert sind, und eine erhöhte Speicherbandbreite. Die Inferenz eines LLM ist vor allem ein Problem der Speicherbandbreite – bei jedem generierten Token werden sämtliche Modellgewichte erneut gelesen. Je schneller der vereinheitlichte Speicher ist, desto schneller werden die Tokens ausgegeben.

Genau hier hat Apples MLX-Framework einen Vorteil gegenüber llama.cpp. MLX ist so programmiert, dass es diese neuen Matrixeinheiten der M5-GPU direkt nutzt, während der Metal-Pfad von llama.cpp allgemeiner bleibt. Das konkrete Ergebnis: Auf derselben Maschine, mit demselben Modell und derselben Quantisierung erzeugt MLX deutlich mehr Tokens pro Sekunde. Der auf dem M3 noch marginale Unterschied wird auf dem M5 deutlich.

i
Dieser Leitfaden ergänzt, er ersetzt nicht
Wenn Sie ein MacBook Pro M4 oder M4 Max nutzen, bleibt der spezielle Leitfaden dafür die Referenz. Hier konzentrieren wir uns darauf, was sich mit dem M5 ändert: die neuen Zahlen, die MLX-Engine von Ollama und die Thunderbolt-5-Cluster. Die Grundlagen (vereinheitlichter Speicher, Wahl der Quantisierung) sind von einer Generation zur nächsten identisch.

#Benchmarks für M5 und M5 Max: die Zahlen für 2026

Das Mac-Kit

Lokale KI auf Ihrem Mac voll ausschöpfen: Unified Memory, MLX vs. GGUF, das passende Modell für Ihren Chip und auf Apple Silicon abgestimmte Einstellungen für Ollama und LM Studio.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Hier finden Sie mit MLX bei der Generierung (Decode) gemessene Größenordnungen für gängige Modelle mit 4-Bit-Quantisierung. Wie immer bei lokaler Inferenz variieren diese Durchsatzwerte je nach Kontextlänge, genauer Modellversion und Temperatur des Rechners: Betrachten Sie sie als Richtwerte, nicht als bis auf das einzelne Token genaue Garantien.

→
Echte Messwerte auf einem M5 Max mit 128 GB
Seit September 2026 veröffentlichen wir einen vollständigen Benchmark, der auf einem MacBook Pro M5 Max mit 40 GPU-Kernen und 128 GB durchgeführt wurde: sechs Modelle, MLX gegen GGUF mit demselben Qwen 3.8 27B, gpt-oss 120B und eine Prefill-Messung anhand eines Dokuments mit 11.280 Wörtern. Die unten genannten Größenordnungen bleiben die ursprünglichen; die gemessenen Zahlen finden Sie im eigens dafür vorgesehenen Leitfaden.
M5 (GPU mit 10 Kernen) — 8B Q4
~55–70 Tokens/s bei der Generierung. Ein 8B-Modell (Qwen 3.5, Granite 4.2, Gemma 4) lässt sich auch auf dem Basischip sehr komfortabel nutzen.
M5 Max — 8B Q4
~230 Tokens/s. Die höhere Speicherbandbreite des Max macht bei kleinen Modellen den Unterschied, bei denen die GPU nie der Engpass ist.
M5 Max — 32B Q4
~55–65 Tokens pro Sekunde. Ein 32B-Modell (Qwen 3.8 27B, Devstral) läuft mit angenehmer Lesegeschwindigkeit und lässt sich gut interaktiv nutzen.
M5 Max — 70B Q4
Ca. 28 Tokens/s. Ein 70B-Modell in Q4 passt bereits mit 48–64 GB vereinheitlichtem Arbeitsspeicher in den Speicher und läuft bei Chats und der Codegenerierung weiterhin flüssig.

Bemerkenswert ist das 70B-Modell mit ~28 Tokens/s auf einem leisen Rechner ohne dedizierte Grafikkarte, der in eine Tasche passt. Zum Vergleich: Auf einem PC braucht man eine RTX 4090 mit 24 GB (und eine teilweise Auslagerung auf die CPU, da ein 70B-Modell in Q4 etwa 40 GB belegt und nicht in 24 GB VRAM passt), um mitzuhalten – bei deutlich mehr Lärm und Stromverbrauch.

→
Der gemeinsame Arbeitsspeicher ist Ihr VRAM
Auf dem Mac gibt es keinen separaten VRAM: Das Modell wird in den vereinheitlichten Speicher geladen, den es sich mit dem System teilt. Richtwerte für Q4 nach Modellgröße: 8B ≈ 5 GB, 32B ≈ 19 GB, 70B ≈ 40 GB. Planen Sie darüber hinaus immer etwa 20 % Reserve für den Kontext und macOS ein. Ein 70B-Modell in Q4 benötigt daher mindestens 48 GB; mit 64 GB haben Sie ausreichend Spielraum.

#MLX vs. llama.cpp: Wo der Abstand größer wird

Der Vorsprung von 30 bis 40 % zugunsten von MLX ist nicht überall gleich: Er hängt vom Lastprofil ab. Zu verstehen, wo dieser Vorsprung größer wird, hilft einzuschätzen, wann sich der Wechsel zu MLX wirklich lohnt.

Generierung (Decoding)
Hier ist der Vorsprung von MLX auf dem M5 am deutlichsten, dank der direkten Nutzung der Matrixeinheiten der GPU. Bei interaktiven Chats ist dies der Unterschied, den Sie spüren.
Promptverarbeitung (prefill)
MLX behält den Vorteil, aber der Abstand ist etwas kleiner. Bei sehr langen Kontexten werden beide Engines durch den Speicher begrenzt.
Modellunterstützung
llama.cpp bleibt dank des GGUF-Formats universeller einsetzbar; MLX erfordert eine ins MLX-Format konvertierte Version. Bei beliebten Modellen ist eine solche Konvertierung fast immer verfügbar (mlx-community-Hub auf Hugging Face).
Python-Integration
MLX bietet eine native Python-Anbindung und ist damit die naheliegende Wahl für Prototyping, leichtes Fine-Tuning oder eine selbst entwickelte Pipeline. llama.cpp nutzt Bindings.
!
Auch MLX kann beim Speicher nicht zaubern
MLX beschleunigt die Inferenz, reduziert aber nicht die Größe des Modells im Speicher. Ein Modell, das nicht in Ihren einheitlichen RAM passt, passt auch unter MLX nicht hinein. Die Wahl der Quantisierung (Q4_K_M als Standard) bleibt der Hebel Nr. 1, um in Ihr Speicherbudget zu passen.

#Voraussetzungen und empfohlene RAM-Kapazität pro Modell

Stimmen Sie vor der Installation die Modellgröße auf Ihren vereinheitlichten Speicher ab. Hier sind die realistischen Größenstufen für M5 und M5 Max in Q4.

16 GB (M5)
Modelle mit 3B bis 8B lassen sich in Q4 problemlos betreiben. Ein 14B-Modell passt ebenfalls, lässt aber wenig Spielraum für einen großen Kontext.
24-32 GB (M5 / M5 Pro)
Ein 14B-Modell läuft problemlos, ein 32B-Modell in Q4 ist am oberen Ende der Speicherspanne nutzbar. Der ideale Kompromiss für einen vielseitigen Einsatz im Alltag.
48 GB (M5 Max)
Ein 32B-Modell in Q4 läuft sehr komfortabel, ein 70B-Modell in Q4 passt gerade so — für ein 70B-Modell mit Kontext sollten Sie besser 64 GB anpeilen.
64–128 GB (M5 Max)
Ein flüssig laufendes 70B-Modell in Q4 mit großem Kontext oder mehrere parallel geladene Modelle. Ein Bereich für Power-User.

Softwareseitig benötigen Sie ein aktuelles macOS und einen der beiden Zugänge zu MLX: LM Studio (das automatisch auf MLX umschaltet, wenn eine MLX-Version des Modells verfügbar ist) oder Ollama seit seinem Update vom Juni 2026, das unmittelbar danach ausführlich erläutert wird.

#Die MLX-Engine von Ollama (Juni 2026)

Früher setzte Ollama auf seine eigene Engine und auf llama.cpp und nutzte daher auf dem Mac Metal. Seit dem Update vom Juni 2026 kann Ollama Modelle auf Apple Silicon über MLX ausführen, sofern eine MLX-Version verfügbar ist – damit erreicht das meistgenutzte Werkzeug für lokale KI endlich die Leistung, die LM Studio bereits über MLX bot.

Konkret bedeutet das, dass Sie den MLX-Vorteil nutzen, ohne Ihre Gewohnheiten zu ändern: derselbe Ollama-Daemon auf dem standardmäßigen Port 11434, dieselben Befehle, dieselbe OpenAI-kompatible API. Die Engine wählt MLX, wenn es sinnvoll ist, und greift andernfalls auf den herkömmlichen Ausführungspfad zurück.

i
Prüfen Sie Ihre Version von Ollama
Die MLX-Unterstützung setzt eine Ollama-Version vom Juni 2026 oder neuer voraus. Aktualisieren Sie Ollama, bevor Sie die Durchsatzraten vergleichen, sonst messen Sie weiterhin den alten Metal-Pfad und kommen fälschlicherweise zu dem Schluss, dass „MLX nichts verändert“.

#Installieren und Starten eines Modells in MLX

Zwei Möglichkeiten, je nachdem, wie vertraut Sie mit dem Terminal sind. Am direktesten lässt sich MLX ohne Konfiguration mit LM Studio ausprobieren; am besten in einen Stack integrieren lässt sich Ollama.

  1. 01
    1. Das Tool aktualisieren
    Installieren Sie die neueste Version von Ollama (Juni 2026 oder neuer) oder von LM Studio. Das ist die Voraussetzung, um den MLX-Ausführungspfad nutzen zu können.
  2. 02
    2. Ein Modell mit MLX-Version auswählen
    In LM Studio zeigt die Suche auf Apple Silicon bevorzugt MLX-Varianten an. Laden Sie in Ollama ein gängiges Modell herunter: Die Inferenz-Engine wechselt zu MLX, wenn eine konvertierte Version vorhanden ist.
  3. 03
    3. Starten und den Durchsatz prüfen
    Stellen Sie eine lange Frage und schauen Sie sich die Tokens/s an. Vergleichen Sie gegebenenfalls das gleiche Modell in GGUF, um den tatsächlichen Unterschied auf Ihrem Gerät zu messen.
  4. 04
    4. Quantisierung anpassen, wenn nötig
    Wenn das Modell Ihren einheitlichen Speicher vollständig auslastet, gehen Sie eine Stufe herunter (Q5 → Q4_K_M), statt das Werkzeug zu wechseln: Der Speicher setzt die Grenze, nicht die Inferenz-Engine.
Terminal
# Vérifier la version d'Ollama (le support MLX date de juin 2026)
ollama --version

# Lancer un modèle : Ollama emprunte MLX quand une version MLX existe
ollama run qwen3:8b

# Le daemon expose l'API compatible OpenAI sur le port par défaut
curl http://localhost:11434/api/tags

In Python lässt sich MLX direkt für Skripte nutzen, etwa um Benchmarks durchzuführen oder die Inferenz in eine eigene Pipeline einzubinden:

Terminal
# Installer les outils MLX pour LLM (framework Apple, natif Python)
pip install mlx-lm

# Générer avec un modèle converti au format MLX (hub mlx-community)
mlx_lm.generate --model mlx-community/Qwen3-8B-4bit \
  --prompt "Explique la mémoire unifiée du M5 en trois phrases"

#Thunderbolt-5-Cluster für Modelle mit 120 Milliarden Parametern oder mehr

Ein einzelner Mac, selbst ein gut ausgestatteter M5 Max, ist durch die Kapazität seines vereinheitlichten Speichers begrenzt. Um diese Grenze zu überschreiten – also ein Modell mit 120 Milliarden Parametern oder mehr oder ein großes MoE-Modell zu betreiben –, besteht der Ansatz im Jahr 2026 darin, mehrere Apple-Silicon-Rechner über Thunderbolt 5 zu verbinden und das Modell auf sie zu verteilen. Thunderbolt 5 bietet eine deutlich höhere Bandbreite als Thunderbolt 4, wodurch der Austausch von Aktivierungen zwischen den Knoten für die Inferenz endlich praktikabel wird.

Das Prinzip: Das Modell wird in Gruppen von Schichten aufgeteilt, jeder Rechner hält einen Teil der Gewichte im Speicher, und die Aktivierungen werden bei jedem Token von einem Knoten zum nächsten weitergegeben. So lässt sich der vereinheitlichte Speicher mehrerer Macs zusammen nutzen, um ein Modell zu laden, das auf keinen von ihnen allein passen würde.

Was dadurch möglich wird
Modelle mit 120B+ in Q4, sogar sehr große MoE-Modelle, indem Sie beispielsweise zwei M5 Max mit jeweils 128 GB kombinieren, um annähernd 256 GB adressierbaren Speicher zu erreichen.
Der Kompromiss
Die Latenz zwischen den Knoten kostet Tokens/s: Ein Cluster ist langsamer als eine einzelne Maschine, auf der dasselbe Modell vollständig Platz hätte. Man nutzt einen Cluster, weil keine einzelne Maschine ausreicht, nicht um mehr Geschwindigkeit zu erreichen.
Die Verkabelung
Thunderbolt 5 ist der Schlüssel: Die Bandbreite macht den Transfer von Aktivierungen akzeptabel. Bei Thunderbolt 4 oder Ethernet wird die Interkonnektion wieder zum Engpass.
!
Der Einsatz von Clustern bleibt eine Nischenanwendung
Mehrere Macs für ein Modell mit 120B oder mehr zu verbinden, ist beeindruckend, lohnt sich aber nur bei einem echten Bedarf: Die Komplexität, die Kosten für zwei Rechner und der geringere Durchsatz sind nur gerechtfertigt, wenn Sie nicht einfach ein kleineres Modell oder einen Mac Studio Ultra mit viel Speicher wählen können. Für die meisten Anwendungen reicht ein einzelner M5 Max völlig aus.

#Tipps und Fehlerbehebung

„MLX ist nicht schneller“
Prüfen Sie zunächst, ob Sie tatsächlich den MLX-Ausführungspfad nutzen (aktuelle Version des Tools, tatsächlich geladene MLX-Variante des Modells). Eine über den Metal-Pfad geladene GGUF-Datei profitiert nicht von MLX.
Durchsatz bricht nach wenigen Minuten ein
Das ist thermische Drosselung, besonders beim MacBook Air (ohne Lüfter). Unter anhaltender Last hält ein MacBook Pro oder ein Mac mini/Studio einen stabileren Durchsatz.
Modell, das sich nicht laden lässt
Der vereinheitlichte Speicher ist voll. Wechseln Sie zu einem kleineren Modell oder zu einer Quantisierung mit einer niedrigeren Bitbreite; schließen Sie Anwendungen, die viel RAM benötigen.
Langsame Verarbeitung bei langem Kontext
Der Prefill eines sehr langen Prompts benötigt viel Arbeitsspeicher. Verkleinern Sie das Kontextfenster, wenn Sie es nicht benötigen, oder nehmen Sie eine längere Wartezeit bis zum ersten Token in Kauf.

#Weiterführende Informationen

Diese Leitfäden knüpfen an das an, was Sie gerade gelesen haben, vom ausführlichen Vergleich bis zur konkreten Umsetzung:

MLX gegenüber llama.cpp im Detail
„MLX vs. llama.cpp auf Macs der M-Serie: Wer gewinnt 2026?“ vertieft den grundlegenden Vergleich (Modellunterstützung, Quantisierung, Python-Integration) über die reinen M5-Zahlen hinaus.
Ollama auf macOS installieren
„Ollama unter macOS (Apple Silicon) installieren“ behandelt die Installation Schritt für Schritt und die Nutzung des gemeinsamen Speichers – eine unverzichtbare Grundlage, bevor Sie sich MLX zuwenden.
Quantisierung wählen
„Die passende Quantisierung wählen (Q4, Q5, Q8, FP16)“ erklärt den Kompromiss zwischen Qualität und Speicherbedarf — der entscheidende Hebel, damit ein Modell in Ihren vereinheitlichten Arbeitsspeicher passt.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.