Tool · Apple Silicon M1 bis M6
Welcher LLM läuft auf meinem Mac ?
Wählen Sie Ihren Chip und Ihre Speicherkapazität: Das Tool listet die Modelle aus dem Katalog auf, die in den verfügbaren Speicher passen, zusammen mit der zu verwendenden Quantisierung und der zu erwartenden Geschwindigkeit.
Ihr Mac
Laden des Katalogs…
Was je nach Arbeitsspeicher Ihres Macs läuft
Der gemeinsame Speicher wird zwischen macOS und den Modellen geteilt. Standardmäßig kann der GPU etwa zwei Drittel bis zu 32 GB und drei Viertel darüber nutzen. Empfehlung: der größte und neueste Modell, das mit Q4 und einem Kontext von 8K auskommt.
| Speicher | Nutzbar | Empfehlung (Q4) |
|---|---|---|
| 8 GB | ≈ 5,4 GB | LFM2.5 7B · Rangliste für 8 GB |
| 16 GB | ≈ 11 GB | Nemotron 3 Super 12B · Rangliste für 16 GB |
| 24 GB | ≈ 16 GB | Devstral Small 2 24B · Rangliste für 24 GB |
| 32 GB | ≈ 21 GB | Laguna XS.2 · Rangliste für 32 GB |
| 36 GB | ≈ 27 GB | Qwen 3.6 35B-A3B |
| 48 GB | ≈ 36 GB | Qwen 3.6 35B-A3B · Rangliste für 48 GB |
| 64 GB | ≈ 48 GB | Nemotron 3 Puzzle 75B-A9B · Rangliste 64 GB |
| 96 GB | ≈ 72 GB | Laguna S 2.1 · Rangliste für 96 GB |
| 128 GB | ≈ 96 GB | Mistral Medium 3.5 128B · Ranking für 128 GB |
| 192 GB | ≈ 144 GB | MiniMax-M2.7 |
| 256 GB | ≈ 192 GB | GLM 5.3 Flash 320B-A18B |
| 512 GB | ≈ 384 GB | Nemotron 3 Ultra (BF16) |
Die Geschwindigkeit hängt vom Chip ab
Bei jedem erzeugten Wort liest der Mac das gesamte Modell erneut aus dem Speicher: Die Bandbreite bestimmt daher die maximale Geschwindigkeit. Bei gleicher Speicherkapazität ist ein Max- oder Ultra-Chip um ein Mehrfaches schneller als ein Basischip.
| Chip | Bandbreite | Vorgeschlagene Speichermengen |
|---|---|---|
| M1 | 68 GB/s | 8, 16 GB |
| M1 Pro | 200 GB/s | 16, 32 GB |
| M1 Max | 400 GB/s | 32, 64 GB |
| M1 Ultra | 800 GB/s | 64, 128 GB |
| M2 | 100 GB/s | 8, 16, 24 GB |
| M2 Pro | 200 GB/s | 16, 32 GB |
| M2 Max | 400 GB/s | 32, 64, 96 GB |
| M2 Ultra | 800 GB/s | 64, 128, 192 GB |
| M3 | 100 GB/s | 8, 16, 24 GB |
| M3 Pro | 150 GB/s | 18, 36 GB |
| M3 Max | 300 bis 400 GB/s | 36, 48, 64, 96, 128 GB |
| M3 Ultra | 819 GB/s | 96, 256, 512 GB |
| M4 | 120 GB/s | 16, 24, 32 GB |
| M4 Pro | 273 GB/s | 24, 48, 64 GB |
| M4 Max | 410 bis 546 GB/s | 36, 48, 64, 128 GB |
| M5 | 153 GB/s | 16, 24, 32 GB |
| M5 Pro | 307 GB/s | 24, 48, 64 GB |
| M5 Max | 460 bis 614 GB/s | 36, 48, 64, 96, 128 GB |
| M5 Ultra | 1200 GB/s | 96, 256, 512 GB |
| M6 | 170 GB/s | 16, 24, 32 GB |
Zwei Werte: Die Version mit weniger GPU-Kernen (und weniger Speicher) hat eine geringere Bandbreite. Quellen: technische Datenblätter von Apple; M5 und M6: unsere Übersichten zu Mac Studio M5 et Mac mini M6.
Häufige Fragen
Kann ein Mac mit 8 GB einen LLM laufen lassen?
Ja, aber nur kleine Modelle: Etwa 5 GB stehen für Modelle zur Verfügung, sodass ein Modell mit 3 bis 4 Milliarden Parametern in Q4 hineinpasst (Qwen 3 4B, Gemma 3 4B). Ab 16 GB lassen sich Modelle mit 7–8 Milliarden Parametern komfortabel betreiben.
Welchen Anteil des vereinheitlichten Speichers kann die GPU nutzen?
Standardmäßig reserviert macOS auf Macs mit bis zu 32 GB Arbeitsspeicher etwa ein Drittel des Speichers für das System, bei größeren Speicherkapazitäten ein Viertel. Ein Mac mit 24 GB stellt den Modellen daher etwa 16 GB zur Verfügung, ein Mac mit 96 GB etwa 72 GB. Mit dem Befehl sysctl iogpu.wired_limit_mb lässt sich diese Grenze erhöhen, wobei genügend Speicher für macOS übrig bleiben muss.
Warum haben zwei Macs mit gleicher Speichergröße nicht die gleiche Geschwindigkeit?
Denn die Generierungsgeschwindigkeit hängt vor allem von der Speicherbandbreite ab: 120 GB/s bei einem M4, 273 GB/s bei einem M4 Pro, 546 GB/s bei einem M4 Max. Bei jedem Wort liest die Maschine das gesamte Modell erneut. Ein M4 Max ist daher etwa 4-mal schneller als ein M4 bei einem Modell, das auf beiden Geräten läuft.
MLX, Ollama oder LM Studio auf dem Mac?
Alle drei funktionieren. MLX, das Framework von Apple, ist auf Apple Silicon oft am schnellsten; LM Studio bietet es mit einer grafischen Benutzeroberfläche an; Ollama ist auf der Kommandozeile am einfachsten zu bedienen und lässt sich in viele Tools integrieren.