MLX: Für Apple Silicon (M1-M4) optimierte LLMs
Das Betreiben eines MLX Apple Silicon LLM Auf einem aktuellen Mac können Sie die gemeinsame Speicherarchitektur der M1- bis M4-Prozessoren nutzen, um lokale Open-Weights-Modelle mit 7 bis 235 Milliarden Parametern auszuführen. Das Framework MLX, veröffentlicht von Apple Research Ende 2023, nutzt direkt den Neural Engine und den integrierten GPU über Metal, ohne CUDA zu verwenden. Dieser Leitfaden erklärt das Funktionieren von MLX, die kompatiblen Modelle, die realistischen VRAM-Werte bei Quantisierung, die beobachteten Geschwindigkeiten auf M3 Max und M4 Pro, die Referenzbenchmarks sowie die robustesten Anwendungsfälle für einen self-hosted-Deployn auf macOS.
Warum MLX auf dem Mac neue Möglichkeiten eröffnet
MLX ist eine Bibliothek für Array-Berechnungen, inspiriert von NumPy und PyTorch, speziell für die gemeinsame Speicherarchitektur von Apple Silicon entwickelt. Im Gegensatz zu llama.cpp das Metal als optionales Backend nutzt, behandelt MLX den CPU- und GPU-Speicher als einen einzigen Speicherbereich: Zwischen beiden sind keine Kopiervorgänge erforderlich. Das offizielle Repository ml-explore/mlx auf GitHub stellt den Quellcode unter der MIT-Lizenz bereit, und das zugehörige Projekt mlx-examples bietet fertige Implementierungen für Llama, Mistral, Phi und Qwen.
Die wichtigsten Punkte zum Merken:
- Unified Memory : Ein Mac Studio M3 Ultra mit 192 GB stellt diese 192 GB der GPU zur Verfügung. Ein PC mit einer RTX 4090 ist auf 24 GB GDDR6X-VRAM begrenzt.
- Native Quantisierung : MLX unterstützt int4, int8 und bfloat16 über
mlx_lm.convert. - Lazy Evaluation : Die Berechnungsgraphen werden nur beim Aufruf materialisiert
mx.eval(), was den Verbrauch reduziert. - Hugging Face-Kompatibilität : die Checkpoints
safetensorsim Standardformat lassen sich mit einem Befehl konvertieren.
Um die Ansätze für Mac und Linux zu vergleichen, siehe llama.cpp und GGUF sowie unseren Vergleich MLX vs llama.cpp.
Erforderlicher VRAM und unterstützte Quantisierungen
MLX bietet mehrere Quantisierungsstufen. Hier sind die Größenordnungen, ausgehend von den FP16-Werten und unter anschließender Anwendung der üblichen Verhältnisse (Q8 ≈ 50 %, Q4 ≈ 25 %, Q3 ≈ 20 %).
Modelle, die auf einem MacBook Pro M3 Max mit 128 GB oder M4 Max mit 128 GB problemlos laufen:
- gpt-oss 120B : VRAM Q4 ~70 GB, Kontext 128k Tokens, Lizenz Apache 2.0. Siehe gpt-oss 120B.
- Llama 3.3 70B Instruct : VRAM bei Q4 ~40 GB, Kontext 128k. Referenz für agentenbasierte Workflows auf dem Mac, Details zu Llama 3.3 70B.
- Qwen 2.5 72B Instruct : VRAM bei Q4 ~42 GB, Kontext 131k. Vollständiges Modellprofil unter Qwen 2.5 72B.
- DeepSeek R1 Distill Llama 70B : VRAM Q4 ~40 GB. Das bekannteste destillierte Reasoning-Modell, Details unter DeepSeek R1 Distill 70B.
Größere Modelle, die dem Mac Studio M3 Ultra mit 192 GB oder 512 GB vorbehalten sind:
- Mixtral 8x22B Instruct : VRAM Q4 ~82 GB, Kontext 64k, Apache 2.0. Siehe Mixtral 8x22B.
- Mistral Small 4 (119B): VRAM Q4 ~72 GB, Kontext 256k. Datenblatt: Mistral Small 4.
- Qwen 3 235B-A22B : VRAM Q4 ~142 GB, Kontext 131k. MoE-Architektur, die nur 22B Parameter aktiviert, Modellprofil Qwen 3 235B-A22B.
- Qwen 3.5 122B-A10B : VRAM in Q4 ~73 GB, Kontext 262k. Siehe Qwen 3.5 122B-A10B.
Bei sehr großen Modellen, DeepSeek V3 671B (VRAM Q4 ~400 GB, Kontextlänge 128k) bleibt selbst auf einem Mac Studio mit 512 GB in Q4 außer Reichweite, wird aber in Q2/Q3 mit etwas Auslagerung auf den Datenträger denkbar. Vollständige Modellbeschreibung unter DeepSeek V3 671B.
Gemessene Leistung: Tokens pro Sekunde
Die Zahlen unten stammen aus der offiziellen Dokumentation mlx-lm und aus reproduzierbaren Beobachtungen der Community auf Hugging Face. Alle Geschwindigkeiten sind Schätzungen und hängen vom Prompt, vom Kontext und vom Quantisierungsgrad ab.
- Llama 3.1 70B in 4-Bit auf einem M3 Max mit 128 GB: ca. 10 bis 12 Tokens/Sekunde bei der Generierung, Prefill ca. 150 Tokens/Sekunde (geschätzt). Datenblatt: Llama 3.1 70B.
- Qwen 2.5 72B in 4-Bit auf dem M4 Max: ~9 bis 11 Tokens pro Sekunde (je nach SoC-Revision noch zu bestätigen).
- gpt-oss 120B mit 4-Bit-Quantisierung auf einem M3 Ultra mit 192 GB: ~14 Tokens/s (geschätzt anhand der Hugging-Face-Benchmarks).
- Mixtral 8x22B Bei 4-Bit auf M3 Ultra: ~18 Tokens pro Sekunde dank MoE-Aktivierung.
- DeepSeek R1 Distill Llama 70B in 4 Bit auf einem M3 Max: ~10 Tokens/Sekunde, einschließlich der ausgegebenen Gedankengänge.
MoE-Modelle wie Qwen3-Coder-Next 80B-A3B (VRAM Q4 ~48 GB) profitieren besonders von Unified Memory: Pro Token durchlaufen nur 3 Milliarden aktive Parameter die Recheneinheiten, wodurch die Geschwindigkeit auf dem M4 Max laut Nutzerberichten auf über 25 Tokens/s steigt (noch zu bestätigen). Siehe Qwen3-Coder-Next 80B-A3B.
Lizenzen und Kompatibilität mit MLX
MLX legt keine Einschränkungen fest, die über die Lizenz des ursprünglichen Modells hinausgehen. Einige typische Fälle:
- Apache 2.0 (Mixtral 8x22B, Mistral Small 4, gpt-oss 120B, Qwen 3 235B-A22B, Qwen 3.5 397B-A17B) : kommerzieller Einsatz ohne Beschränkungen.
- MIT (DeepSeek R1 671B, GLM-5.1, Ling 2.6 1T): sehr freizügig, Namensnennung erforderlich.
- Llama Community (Llama 3.1 70B, Llama 3.1 405B, Llama 4 Scout 109B): erlaubt die kommerzielle Nutzung unterhalb der Schwelle von 700 Millionen monatlich aktiven Nutzern.
- Qwen License (Qwen 2.5 72B, Qwen 2.5 VL 72B) : spezielle Bedingungen für große Plattformen.
- CC-BY-NC 4.0 (Command R+ 104B): ausschließlich für nichtkommerzielle Nutzung.
Für den Einsatz im Produktivbetrieb bevorzugen Sie Apache 2.0 oder MIT. Siehe unseren Leitfaden Lizenzen für Open-Weights-LLM für Details zu den Klauseln.
Referenzbenchmarks für MLX-kompatible Modelle
Die hier angegebenen Ergebnisse stammen aus offiziellen technischen Dokumenten auf Hugging Face sowie aus den Modellkarten der Hersteller.
- MMLU : Llama 3.3 70B erreicht ~86, Qwen 2.5 72B ~85, gpt-oss 120B ~88 (geschätzt).
- HumanEval : Qwen3-Coder-Next 80B-A3B zielt auf >85 % pass@1 ab, DeepSeek R1 Distill Llama 70B auf ~78 % (noch zu bestätigen).
- AIME 2024 : DeepSeek R1 671B erreicht 79,8 % laut dem arXiv-Artikel DeepSeek R1. Das destillierte 70B-Modell erreicht ~70 %.
- GPQA Diamond : DeepSeek R1 ~71 %, Llama 3.3 70B ~50 % (geschätzt).
Für einen detaillierten Überblick über die leistungsfähigsten Modelle für Code siehe bester LLM für Code und für das Reasoning bestes LLM für logisches Schlussfolgern.
Installation und konkreter Workflow
Nach der Vorbereitung einer Python-Umgebung mit Version 3.10+ genügen drei Befehle für die Installation:
pip install mlx mlx-lm
python -m mlx_lm.convert --hf-path meta-llama/Llama-3.3-70B-Instruct -q
python -m mlx_lm.generate --model ./mlx_model --prompt "Bonjour"
Die Konvertierung -q wirkt standardmäßig mit 4-Bit-Quantisierung. Die konvertierten Checkpoints werden direkt auf veröffentlicht Hugging Face mlx-community, wodurch bei beliebten Modellen die lokale Konvertierung entfällt.
Anwendungsfälle, in denen MLX besonders gut abschneidet:
- Unabhängige Mac-Entwickler : Ein MacBook Pro M3 Max mit 64 GB reicht aus, um Llama 3.3 70B in Q3 oder Qwen 2.5 72B in Q3 auszuführen.
- lokale RAG-Workflows : der vereinheitlichte Speicher ermöglicht es, einen langen Kontext (128k oder sogar 256k Tokens) ohne Auslagerung auf den Massenspeicher beizubehalten.
- Private Coding-Agents : Qwen3-Coder-Next 80B-A3B als MoE-Modell mit 4-Bit-Quantisierung läuft bei der Codevervollständigung in der IDE weiterhin flüssig.
- Akademische Forschung : MLX integriert
mlx.optimizersum direkt auf Apple Silicon LoRA-Fine-Tuning durchzuführen (siehe LoRA-Beispiele in mlx-examples).
Um MacBook Pro und Mac Studio im Hinblick auf das gewünschte Modell zu vergleichen, lesen Sie LLM für MacBook Pro.
FAQ
F: Welchen Mac sollten Sie wählen, um Llama 3.3 70B lokal zu betreiben?
Ein MacBook Pro M3 Max oder M4 Max mit 64 GB ermöglicht die Ausführung von Llama 3.3 70B Instruct in 4-Bit-Quantisierung (VRAM ~40 GB). Mit 48 GB ist es knapp, aber in Q3 möglich. Für lange Kontexte oder Batches sollten Sie 128 GB anstreben. Der Mac Studio M3 Ultra mit 192 GB bleibt die komfortabelste Konfiguration für dieses Modell.
F: Ist MLX auf dem Mac schneller als llama.cpp?
MLX erzielt bei der Generierung langer Texte dank nativer Nutzung des vereinheitlichten Speichers und des Graph-Compilers in der Regel einen Leistungsgewinn von 10 bis 30 %. llama.cpp bleibt beim Prefill wettbewerbsfähig und bietet ein breiteres Ökosystem (integrierter OpenAI-kompatibler Server, vielfältigere GGUF-Quantisierungen). Beide können koexistieren: MLX für die Entwicklung, llama.cpp für den headless-Betrieb.
F: Kann man mit MLX LoRA-Fine-tuning durchführen?
Ja. Das Teilprojekt mlx-examples/lora ermöglicht das Training von LoRA- und QLoRA-Adaptern für Llama, Mistral und Qwen. Auf einem M3 Max mit 64 GB ein LoRA-Fine-Tuning von Mistral Small 4 in 4-Bit bleibt außer Reichweite, aber Modelle mit 7B bis 13B lassen sich in wenigen Stunden trainieren.
Frage: Unterstützt MLX MoE-Modelle wie Mixtral oder Qwen 3 235B?
Ja. Mixtral 8x22B Instruct et Qwen 3 235B-A22B sind über mlx-lm. Die MoE-Architektur eignet sich besonders für vereinheitlichten Speicher: Die inaktiven Experten liegen im RAM, ohne die Latenz zu beeinträchtigen. Auf einem Mac Studio M3 Ultra mit 192 GB bleibt Qwen 3 235B-A22B in 4-Bit-Quantisierung mit einer angemessenen Kontextlänge nutzbar.
F: Welche Modelle lassen sich auf Apple Silicon nicht sinnvoll betreiben?
Modelle >500B mit voller Präzision bleiben selbst für den Mac Studio mit 512 GB außer Reichweite: DeepSeek V4 Pro 1.6T (VRAM Q4 ~960 GB), MiMo V2.5 Pro (VRAM Q4 ~595 GB), Kimi K2.6 (VRAM in Q4 ~600 GB). Mit aggressiver Q2- oder Q3-Quantisierung und Auslagerung auf die Festplatte lassen sich einige experimentell testen, doch die Geschwindigkeit sinkt drastisch.
F: Unterstützt MLX Vision-Language-Modelle?
Ja, teilweise. Qwen 2.5 VL 72B et LLaVA-OneVision 72B verfügen über MLX-Portierungen aus der Community auf Hugging Face. Die Abdeckung ist eingeschränkter als bei reinen Text-LLMs, aber das Projekt mlx-vlm wird von der Community gepflegt und schließt die Lücke bei gängigen multimodalen Architekturen.
Fazit
Un MLX Apple Silicon LLM macht einen aktuellen Mac zu einer leistungsfähigen Inferenzstation: Llama 3.3 70B, Qwen 2.5 72B oder gpt-oss 120B laufen mit 4-Bit-Quantisierung auf einem MacBook Pro mit 64-128 GB, und MoE-Modelle wie Qwen 3 235B-A22B lassen sich auf einem Mac Studio mit 192 GB betreiben. Um das passende Modell für Ihre genaue Hardwarekonfiguration auszuwählen, verwenden Sie unseren Konfigurator oder durchsuchen Sie den komplettes Katalog der 249 indexierten Modelle.