MLX: Für Apple Silicon (M1-M4) optimierte LLMs

Das Betreiben eines MLX Apple Silicon LLM Auf einem aktuellen Mac können Sie die gemeinsame Speicherarchitektur der M1- bis M4-Prozessoren nutzen, um lokale Open-Weights-Modelle mit 7 bis 235 Milliarden Parametern auszuführen. Das Framework MLX, veröffentlicht von Apple Research Ende 2023, nutzt direkt den Neural Engine und den integrierten GPU über Metal, ohne CUDA zu verwenden. Dieser Leitfaden erklärt das Funktionieren von MLX, die kompatiblen Modelle, die realistischen VRAM-Werte bei Quantisierung, die beobachteten Geschwindigkeiten auf M3 Max und M4 Pro, die Referenzbenchmarks sowie die robustesten Anwendungsfälle für einen self-hosted-Deployn auf macOS.

Warum MLX auf dem Mac neue Möglichkeiten eröffnet

MLX ist eine Bibliothek für Array-Berechnungen, inspiriert von NumPy und PyTorch, speziell für die gemeinsame Speicherarchitektur von Apple Silicon entwickelt. Im Gegensatz zu llama.cpp das Metal als optionales Backend nutzt, behandelt MLX den CPU- und GPU-Speicher als einen einzigen Speicherbereich: Zwischen beiden sind keine Kopiervorgänge erforderlich. Das offizielle Repository ml-explore/mlx auf GitHub stellt den Quellcode unter der MIT-Lizenz bereit, und das zugehörige Projekt mlx-examples bietet fertige Implementierungen für Llama, Mistral, Phi und Qwen.

Die wichtigsten Punkte zum Merken:

Um die Ansätze für Mac und Linux zu vergleichen, siehe llama.cpp und GGUF sowie unseren Vergleich MLX vs llama.cpp.

Erforderlicher VRAM und unterstützte Quantisierungen

MLX bietet mehrere Quantisierungsstufen. Hier sind die Größenordnungen, ausgehend von den FP16-Werten und unter anschließender Anwendung der üblichen Verhältnisse (Q8 ≈ 50 %, Q4 ≈ 25 %, Q3 ≈ 20 %).

Modelle, die auf einem MacBook Pro M3 Max mit 128 GB oder M4 Max mit 128 GB problemlos laufen:

Größere Modelle, die dem Mac Studio M3 Ultra mit 192 GB oder 512 GB vorbehalten sind:

Bei sehr großen Modellen, DeepSeek V3 671B (VRAM Q4 ~400 GB, Kontextlänge 128k) bleibt selbst auf einem Mac Studio mit 512 GB in Q4 außer Reichweite, wird aber in Q2/Q3 mit etwas Auslagerung auf den Datenträger denkbar. Vollständige Modellbeschreibung unter DeepSeek V3 671B.

Gemessene Leistung: Tokens pro Sekunde

Die Zahlen unten stammen aus der offiziellen Dokumentation mlx-lm und aus reproduzierbaren Beobachtungen der Community auf Hugging Face. Alle Geschwindigkeiten sind Schätzungen und hängen vom Prompt, vom Kontext und vom Quantisierungsgrad ab.

MoE-Modelle wie Qwen3-Coder-Next 80B-A3B (VRAM Q4 ~48 GB) profitieren besonders von Unified Memory: Pro Token durchlaufen nur 3 Milliarden aktive Parameter die Recheneinheiten, wodurch die Geschwindigkeit auf dem M4 Max laut Nutzerberichten auf über 25 Tokens/s steigt (noch zu bestätigen). Siehe Qwen3-Coder-Next 80B-A3B.

Lizenzen und Kompatibilität mit MLX

MLX legt keine Einschränkungen fest, die über die Lizenz des ursprünglichen Modells hinausgehen. Einige typische Fälle:

Für den Einsatz im Produktivbetrieb bevorzugen Sie Apache 2.0 oder MIT. Siehe unseren Leitfaden Lizenzen für Open-Weights-LLM für Details zu den Klauseln.

Referenzbenchmarks für MLX-kompatible Modelle

Die hier angegebenen Ergebnisse stammen aus offiziellen technischen Dokumenten auf Hugging Face sowie aus den Modellkarten der Hersteller.

Für einen detaillierten Überblick über die leistungsfähigsten Modelle für Code siehe bester LLM für Code und für das Reasoning bestes LLM für logisches Schlussfolgern.

Installation und konkreter Workflow

Nach der Vorbereitung einer Python-Umgebung mit Version 3.10+ genügen drei Befehle für die Installation:

pip install mlx mlx-lm
python -m mlx_lm.convert --hf-path meta-llama/Llama-3.3-70B-Instruct -q
python -m mlx_lm.generate --model ./mlx_model --prompt "Bonjour"

Die Konvertierung -q wirkt standardmäßig mit 4-Bit-Quantisierung. Die konvertierten Checkpoints werden direkt auf veröffentlicht Hugging Face mlx-community, wodurch bei beliebten Modellen die lokale Konvertierung entfällt.

Anwendungsfälle, in denen MLX besonders gut abschneidet:

Um MacBook Pro und Mac Studio im Hinblick auf das gewünschte Modell zu vergleichen, lesen Sie LLM für MacBook Pro.

FAQ

F: Welchen Mac sollten Sie wählen, um Llama 3.3 70B lokal zu betreiben?

Ein MacBook Pro M3 Max oder M4 Max mit 64 GB ermöglicht die Ausführung von Llama 3.3 70B Instruct in 4-Bit-Quantisierung (VRAM ~40 GB). Mit 48 GB ist es knapp, aber in Q3 möglich. Für lange Kontexte oder Batches sollten Sie 128 GB anstreben. Der Mac Studio M3 Ultra mit 192 GB bleibt die komfortabelste Konfiguration für dieses Modell.

F: Ist MLX auf dem Mac schneller als llama.cpp?

MLX erzielt bei der Generierung langer Texte dank nativer Nutzung des vereinheitlichten Speichers und des Graph-Compilers in der Regel einen Leistungsgewinn von 10 bis 30 %. llama.cpp bleibt beim Prefill wettbewerbsfähig und bietet ein breiteres Ökosystem (integrierter OpenAI-kompatibler Server, vielfältigere GGUF-Quantisierungen). Beide können koexistieren: MLX für die Entwicklung, llama.cpp für den headless-Betrieb.

F: Kann man mit MLX LoRA-Fine-tuning durchführen?

Ja. Das Teilprojekt mlx-examples/lora ermöglicht das Training von LoRA- und QLoRA-Adaptern für Llama, Mistral und Qwen. Auf einem M3 Max mit 64 GB ein LoRA-Fine-Tuning von Mistral Small 4 in 4-Bit bleibt außer Reichweite, aber Modelle mit 7B bis 13B lassen sich in wenigen Stunden trainieren.

Frage: Unterstützt MLX MoE-Modelle wie Mixtral oder Qwen 3 235B?

Ja. Mixtral 8x22B Instruct et Qwen 3 235B-A22B sind über mlx-lm. Die MoE-Architektur eignet sich besonders für vereinheitlichten Speicher: Die inaktiven Experten liegen im RAM, ohne die Latenz zu beeinträchtigen. Auf einem Mac Studio M3 Ultra mit 192 GB bleibt Qwen 3 235B-A22B in 4-Bit-Quantisierung mit einer angemessenen Kontextlänge nutzbar.

F: Welche Modelle lassen sich auf Apple Silicon nicht sinnvoll betreiben?

Modelle >500B mit voller Präzision bleiben selbst für den Mac Studio mit 512 GB außer Reichweite: DeepSeek V4 Pro 1.6T (VRAM Q4 ~960 GB), MiMo V2.5 Pro (VRAM Q4 ~595 GB), Kimi K2.6 (VRAM in Q4 ~600 GB). Mit aggressiver Q2- oder Q3-Quantisierung und Auslagerung auf die Festplatte lassen sich einige experimentell testen, doch die Geschwindigkeit sinkt drastisch.

F: Unterstützt MLX Vision-Language-Modelle?

Ja, teilweise. Qwen 2.5 VL 72B et LLaVA-OneVision 72B verfügen über MLX-Portierungen aus der Community auf Hugging Face. Die Abdeckung ist eingeschränkter als bei reinen Text-LLMs, aber das Projekt mlx-vlm wird von der Community gepflegt und schließt die Lücke bei gängigen multimodalen Architekturen.

Fazit

Un MLX Apple Silicon LLM macht einen aktuellen Mac zu einer leistungsfähigen Inferenzstation: Llama 3.3 70B, Qwen 2.5 72B oder gpt-oss 120B laufen mit 4-Bit-Quantisierung auf einem MacBook Pro mit 64-128 GB, und MoE-Modelle wie Qwen 3 235B-A22B lassen sich auf einem Mac Studio mit 192 GB betreiben. Um das passende Modell für Ihre genaue Hardwarekonfiguration auszuwählen, verwenden Sie unseren Konfigurator oder durchsuchen Sie den komplettes Katalog der 249 indexierten Modelle.

Artikel veröffentlicht am von Mohamed Meguedmi · Quelle der Daten: /api/models.json · Lizenz für den Inhalt: CC BY 4.0.

Möchten Sie einen Fehler oder eine Aktualisierung melden? Mitwirken.