Bester LLM auf einem Mac M4 Pro (24–48 GB vereinheitlichter Speicher) 2026

Die Wahl des besten LLM für einen Mac M4 Pro hängt vor allem vom verfügbaren gemeinsamen Speicher ab: Auf einem M4 Pro mit 24 GB lassen sich nicht dieselben Modellgewichte ausführen wie auf einem M4 Pro mit 48 GB. Bei Apple Silicon nutzen RAM und VRAM einen gemeinsamen Speicher. Das ermöglicht den Einsatz von 70B-Modellen mit 4-Bit-Quantisierung, während eine Grafikkarte für den Massenmarkt bei 24 GB an ihre Grenze stößt. Dieser Leitfaden vergleicht die Open-Weights-Modelle, die auf dieser Konfiguration tatsächlich laufen, erläutert praktikable Quantisierungen und beobachtete Geschwindigkeiten und zeigt, welcher Software-Stack (Ollama, llama.cpp, MLX) für einen strikt selbst gehosteten Einsatz zu bevorzugen ist.

Speicherbeschränkungen eines Mac M4 Pro bei der lokalen Inferenz

Der M4 Pro bietet je nach bestellter Konfiguration 24 GB oder 48 GB vereinheitlichten Speicher. macOS reserviert etwa 4 bis 8 GB für das System und die Anwendungen, sodass ungefähr Folgendes übrig bleibt:

Die von Apple angegebene Speicherbandbreite beträgt beim M4 Pro 273 GB/s laut offizielles Datenblatt zu Apple Silicon, ein wesentlicher begrenzender Faktor für den Durchsatz in Tokens/s, da die Inferenz in der Decodierungsphase durch die Bandbreite begrenzt ist. Das wired memory limit lässt sich erhöhen mit sudo sysctl iogpu.wired_limit_mb damit ein größeres Modell vollständig im GPU-Speicher liegen kann — eine Technik, dokumentiert von der llama.cpp-Community.

70B-Modelle in Q4 auf M4 Pro 48 GB

Die Konfiguration mit 48 GB ermöglicht den Einsatz von 70B-Modellen in Q4_K_M, dem optimalen Kompromiss zwischen Qualität und Speicherbedarf bei der Llama-Familie und ihren Ableitungen. Die ernstzunehmenden Kandidaten:

Bei 48 GB bleibt Q4_K_M die vorsichtige Wahl: Q5 (~48–50 GB) funktioniert, schöpft den Speicher aber vollständig aus, wodurch Swapping und ein Einbruch des Durchsatzes drohen. Zum Vergleich dieser Modelle siehe Llama 3.3 70B vs Qwen 2.5 72B.

MoE-Modelle: Geschwindigkeit bei 32–48 GB

Mixture-of-Experts-Architekturen aktivieren bei jedem Token einen Bruchteil der Gesamtparameter, was den Rechenaufwand drastisch reduziert, während der gesamte Speicherbedarf bestehen bleibt. Zwei bemerkenswerte Kandidaten für den M4 Pro mit 48 GB:

Bei diesen Architekturen kann der beobachtete Durchsatz beim Decodieren auf einem M4 Pro mit 48 GB über 20 Tokens pro Sekunde liegen (geschätzt anhand der von der MLX-Community veröffentlichten Benchmarks), wodurch die interaktive Nutzung deutlich flüssiger wird als mit einem dichten 70B-Modell.

Konfigurationen mit 24 GB: aggressive Quantisierungen

Auf einem M4 Pro mit 24 GB findet kein 70B-Modell in Q4 Platz. Drei rein selbst gehostete Lösungswege:

  1. Llama 3.3 70B Q2_K (~26 GB) mit teilweiser Auslagerung auf die SSD: möglich, aber langsam und mit deutlichem Qualitätsverlust. Nicht empfohlen.
  2. Dichte Modelle mit 30–40 Milliarden Parametern in Q4 (außerhalb des obigen Katalogs, siehe /catalogue für die 32B-Optionen).
  3. kompakte MoE-Modelle wie Qwen3-Coder-Next in Q3 (~36-38 GB) liegen außerhalb der 24 GB-Grenze.

Für dieses Profil lautet die pragmatische Empfehlung, Modelle mit einem Speicherbedarf von ≤16 GB in Q4 (Modellfamilien mit 7B–14B) anzustreben. Diese liegen außerhalb des Rahmens dieses auf 70B+ konzentrierten Artikels. Siehe auch unseren Vergleich bestes LLM für Mac M4 für Einstiegskonfigurationen.

Empfohlener Technologie-Stack: Ollama, llama.cpp, MLX

Drei Runtimes dominieren das Apple-Silicon-Ökosystem:

Für den täglichen Einsatz von LLMs auf einem MacBook Pro M4 deckt Ollama 90 % der Anforderungen ab. Für maximale Leistung oder Forschung wird MLX relevant.

FAQ

F: Welche Quantisierung sollte man auf einem M4 Pro mit 48 GB wählen?

Q4_K_M ist der Standard für 70B-Modelle auf 48 GB: ein bewährter Kompromiss zwischen Qualität und Speicherbedarf, ~40 GB für Llama 3.3 oder Qwen 2.5 72B. Q5 schöpft den Speicher aus. Q3_K_M gibt ~10 GB frei, allerdings auf Kosten einer spürbaren Qualitätsverschlechterung bei Code und komplexem Reasoning.

F: Kann man DeepSeek V3 oder R1 671B auf einem M4 Pro mit 48 GB betreiben?

Nein. DeepSeek V3 671B erfordert ~400 GB in Q4, also das 8- bis 10-Fache des Speichers eines M4 Pro mit 48 GB. Diese Modelle Mac Studio M4 Ultra mit 192–512 GB oder Multi-GPU-Servern vorbehalten.

Q: Wie viele Tokens pro Sekunde kann man auf dem M4 Pro 48 GB mit Llama 3.3 70B Q4 erwarten?

Schätzung zwischen 7 und 10 Tokens pro Sekunde beim Decodieren gemäß der Kontextlänge und dem Laufzeitverhalten. Der Promptverarbeitung ist viel schneller (50–100 Tokens pro Sekunde). Die Zahlen sind auf Ihrer genauen Konfiguration zu bestätigen.

F: MLX oder llama.cpp – was sollte man bevorzugen?

llama.cpp bleibt ausgereifter und ist mit dem universellen GGUF-Ökosystem kompatibel. MLX liegt bei bestimmten MoE-Modellen vorn und bietet eine native Apple-Integration. Beide Lösungen mit dem vorgesehenen Modell testen, bevor eine Entscheidung getroffen wird.

F: Lässt sich Qwen3-Coder-Next 80B-A3B mit 48 GB sinnvoll betreiben?

Gerade noch. Q4 belegt etwa 48 GB und lässt keinen Spielraum. Q3_K_M bevorzugen (geschätzt etwa 36–38 GB), da es Platz für den KV-Cache bei langen Kontexten lässt. Das Verhältnis von 3 Milliarden aktiven zu insgesamt 80 Milliarden Parametern ist äußerst günstig für den Durchsatz auf Apple Silicon.

Fazit

Das beste LLM für einen Mac M4 Pro hängt unmittelbar von Ihrem vereinheitlichten Speicher ab: Llama 3.3 70B Q4 oder Qwen 2.5 72B Q4 bei 48 GB für ein ausgewogenes dichtes Modell, Qwen3-Coder-Next 80B-A3B Q3 für MoE-Geschwindigkeit, DeepSeek R1 Distill 70B für Schlussfolgerungen. Bei 24 GB kleinere Modelle anstreben. Präzisieren Sie Ihre Auswahl anhand Ihrer genauen RAM-Kapazität und Ihres Anwendungsfalls über den Konfigurator oder stöbern Sie durch sämtliche Modelle im Katalog.

Artikel veröffentlicht und aktualisiert am von Mohamed Meguedmi · Quelle der Daten: /api/models.json · Lizenz für den Inhalt: CC BY 4.0.

Möchten Sie einen Fehler oder eine Aktualisierung melden? Mitwirken.