◆ Mac — Lokale KI auf Ihrem Mac, voll ausgereizt — Unified Memory, MLX, das richtige Modell für Ihren Chip · 24 € · oder alle Kits für 49 € →

Tool · Apple Silicon M1 bis M6

Welcher LLM läuft auf meinem Mac ?

Wählen Sie Ihren Chip und Ihre Speicherkapazität: Das Tool listet die Modelle aus dem Katalog auf, die in den verfügbaren Speicher passen, zusammen mit der zu verwendenden Quantisierung und der zu erwartenden Geschwindigkeit.

Ihr Mac

Laden des Katalogs…

Was je nach Arbeitsspeicher Ihres Macs läuft

Der gemeinsame Speicher wird zwischen macOS und den Modellen geteilt. Standardmäßig kann der GPU etwa zwei Drittel bis zu 32 GB und drei Viertel darüber nutzen. Empfehlung: der größte und neueste Modell, das mit Q4 und einem Kontext von 8K auskommt.

Die Geschwindigkeit hängt vom Chip ab

Bei jedem erzeugten Wort liest der Mac das gesamte Modell erneut aus dem Speicher: Die Bandbreite bestimmt daher die maximale Geschwindigkeit. Bei gleicher Speicherkapazität ist ein Max- oder Ultra-Chip um ein Mehrfaches schneller als ein Basischip.

ChipBandbreiteVorgeschlagene Speichermengen
M168 GB/s8, 16 GB
M1 Pro200 GB/s16, 32 GB
M1 Max400 GB/s32, 64 GB
M1 Ultra800 GB/s64, 128 GB
M2100 GB/s8, 16, 24 GB
M2 Pro200 GB/s16, 32 GB
M2 Max400 GB/s32, 64, 96 GB
M2 Ultra800 GB/s64, 128, 192 GB
M3100 GB/s8, 16, 24 GB
M3 Pro150 GB/s18, 36 GB
M3 Max300 bis 400 GB/s36, 48, 64, 96, 128 GB
M3 Ultra819 GB/s96, 256, 512 GB
M4120 GB/s16, 24, 32 GB
M4 Pro273 GB/s24, 48, 64 GB
M4 Max410 bis 546 GB/s36, 48, 64, 128 GB
M5153 GB/s16, 24, 32 GB
M5 Pro307 GB/s24, 48, 64 GB
M5 Max460 bis 614 GB/s36, 48, 64, 96, 128 GB
M5 Ultra1200 GB/s96, 256, 512 GB
M6170 GB/s16, 24, 32 GB

Zwei Werte: Die Version mit weniger GPU-Kernen (und weniger Speicher) hat eine geringere Bandbreite. Quellen: technische Datenblätter von Apple; M5 und M6: unsere Übersichten zu Mac Studio M5 et Mac mini M6.

Häufige Fragen

Kann ein Mac mit 8 GB einen LLM laufen lassen?

Ja, aber nur kleine Modelle: Etwa 5 GB stehen für Modelle zur Verfügung, sodass ein Modell mit 3 bis 4 Milliarden Parametern in Q4 hineinpasst (Qwen 3 4B, Gemma 3 4B). Ab 16 GB lassen sich Modelle mit 7–8 Milliarden Parametern komfortabel betreiben.

Welchen Anteil des vereinheitlichten Speichers kann die GPU nutzen?

Standardmäßig reserviert macOS auf Macs mit bis zu 32 GB Arbeitsspeicher etwa ein Drittel des Speichers für das System, bei größeren Speicherkapazitäten ein Viertel. Ein Mac mit 24 GB stellt den Modellen daher etwa 16 GB zur Verfügung, ein Mac mit 96 GB etwa 72 GB. Mit dem Befehl sysctl iogpu.wired_limit_mb lässt sich diese Grenze erhöhen, wobei genügend Speicher für macOS übrig bleiben muss.

Warum haben zwei Macs mit gleicher Speichergröße nicht die gleiche Geschwindigkeit?

Denn die Generierungsgeschwindigkeit hängt vor allem von der Speicherbandbreite ab: 120 GB/s bei einem M4, 273 GB/s bei einem M4 Pro, 546 GB/s bei einem M4 Max. Bei jedem Wort liest die Maschine das gesamte Modell erneut. Ein M4 Max ist daher etwa 4-mal schneller als ein M4 bei einem Modell, das auf beiden Geräten läuft.

MLX, Ollama oder LM Studio auf dem Mac?

Alle drei funktionieren. MLX, das Framework von Apple, ist auf Apple Silicon oft am schnellsten; LM Studio bietet es mit einer grafischen Benutzeroberfläche an; Ollama ist auf der Kommandozeile am einfachsten zu bedienen und lässt sich in viele Tools integrieren.

Mehr kostenlose Tools