Welcher LLM für MacBook Air M4 (16 / 24 / 32 GB) ?
Das MacBook Air M4 führt Modelle mit 8 bis 12 Milliarden Parametern mit 16 GB, ein 24B-Modell in Q4 mit 24 GB und ein MoE-Modell mit 30B mit 32 GB problemlos aus. Seine Speicherbandbreite von 120 GB/s begrenzt ein 8B-Modell in Q4 auf etwa 24 Tokens pro Sekunde; der nicht erweiterbare Arbeitsspeicher bestimmt die Modellgröße.
Der M4 ist der erste Air, dessen Speicherausstattung bei 16 GB beginnt und bis zu 32 GB reicht. Diese Seite zeigt, welche Speicherausstattung Sie wählen sollten, berechnet die maximale Geschwindigkeit, die der Chip erreichen kann, vergleicht ihn mit dem Air M5, dem MacBook Pro und dem Mac mini und zeigt die Grenzen des Air auf.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: MacBook Pro M5 Pro — 24 GB / 1 TB.
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#MacBook Air M4: 120 GB/s und bis zu 32 GB Speicher
Das MacBook Air M4 ist das erste Air, dessen Basiskonfiguration 16 GB vereinheitlichten Speicher bietet und das mit bis zu 32 GB erhältlich ist, bei einer Bandbreite von 120 GB/s. Für ein LLM zählen diese beiden Werte mehr als die Anzahl der Kerne: Der Speicher bestimmt die Größe des Modells, das geladen werden kann, die Bandbreite dessen maximale Geschwindigkeit. Bei 120 GB/s überschreitet ein Modell mit 8 Milliarden Parametern in Q4 theoretisch nicht 24 Tokens pro Sekunde; die tatsächliche Geschwindigkeit ist niedriger.
- Chip
- Apple M4: CPU mit 10 Kernen (4 Performance-Kerne, 6 Effizienzkerne), GPU mit 8 oder 10 Kernen, Neural Engine mit 16 Kernen, laut Apples technischen Daten.
- Speicher
- Standardmäßig 16 GB, auf 24 oder 32 GB konfigurierbar. Der Arbeitsspeicher ist verlötet: Die Konfiguration wird beim Kauf gewählt.
- Bandbreite
- 120 GB/s laut dem Datenblatt von Apple, also 20 % mehr als die 100 GB/s des Air M3.
- Neural Engine
- Apple gibt für den M4 bis zu 38.000 Milliarden Operationen pro Sekunde an. Die gängigen Engines (Ollama, llama.cpp) laufen hauptsächlich über Metal auf der GPU; diese Zahl lässt sich daher nicht in Tokens pro Sekunde umrechnen.
- Kühlung
- Ohne Lüfter: Die Wärme wird über das Gehäuse abgeführt, was sehr lange Lastphasen begrenzt.
Auf einem Mac gibt es keinen separaten VRAM: Die GPU nutzt den vereinheitlichten Speicher. Wenn man nach „VRAM des MacBook Air M4“ sucht, lautet die praktische Antwort: der gesamte Speicher abzüglich des für das System reservierten Anteils, begrenzt durch die Obergrenze, die macOS der GPU erlaubt. Diese Grenze lässt sich anpassen; der Leitfaden zur macOS-Optimierung auf dieser Website erklärt, wie das geht und welche Risiken damit verbunden sind.
#16, 24 oder 32 GB: die Speichergröße wählen
Lokale KI auf Ihrem Mac voll ausschöpfen: Unified Memory, MLX vs. GGUF, das passende Modell für Ihren Chip und auf Apple Silicon abgestimmte Einstellungen für Ollama und LM Studio.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Das Modell, sein Kontext und das System teilen sich den Speicher. Die folgenden Spielräume sind vorsichtige Schätzungen, die mit dem Speicherdruck in der Aktivitätsanzeige abgeglichen werden sollten: etwa 11 bis 12 GB für ein Modell bei insgesamt 16 GB Speicher, 17 bis 19 GB bei 24 GB und 24 bis 26 GB bei 32 GB. Die Modellgrößen entsprechen den Richtwerten der Website: 8B etwa 5 GB, 14B etwa 9 GB, 24B etwa 14 GB, 32B etwa 19 bis 20 GB in Q4.
| Speicher | Geschätzte Speicherreserve | Modellklasse mit ausreichend Spielraum | An der Grenze |
|---|---|---|---|
| 16 GB | ≈ 11 bis 12 GB | 8-9B mit mittlerem Kontext, 12B in Q4 | 14B in Q4 mit kurzem Kontext |
| 24 GB | ≈ 17 bis 19 GB | 12-14B komfortabel, 24B in Q4 (≈ 14 GB) | 27B in Q4 (≈ 16 GB) mit reduziertem Kontext |
| 32 GB | ≈ 24 bis 26 GB | 24B in Q5–Q6, 27B in Q4, MoE-Modelle mit 30B | Dichtes 32B-Modell in Q4 (≈ 19–20 GB) mit langem Kontext |
Die Frage ist daher, welche Modellgröße Sie anstreben. Wenn Sie sich auf Modelle mit 8 bis 12 Milliarden Parametern beschränken, reichen 16 GB aus. Für 24B-Modelle oder für RAG mit parallel laufendem Embedder und Reranker sind 24 GB die erste komfortable Speicherstufe. Mit 32 GB gewinnen Sie vor allem Spielraum für langen Kontext und 30B-MoE-Modelle.
#Die maximale Geschwindigkeit bei 120 GB/s
Das Prinzip: Jedes generierte Token erfordert das Lesen der aktiven Gewichte. Die Obergrenze ergibt sich aus der Bandbreite geteilt durch die Größe der Gewichte in Gigabyte. Die Tabelle wendet diese Formel auf den M4 (120 GB/s) an. Das sind berechnete Obergrenzen, keine Messwerte: Die tatsächliche Geschwindigkeit hängt von der Inferenz-Engine, der Quantisierung, dem Kontext und der Temperatur des Chips ab.
| Modell | Aktive Gewichte | Berechnung | Obergrenze |
|---|---|---|---|
| 3B | ≈ 2 GB | 120 ÷ 2 | ≈ 60 Tok/s |
| 8B | ≈ 5 GB | 120 ÷ 5 | ≈ 24 Tok/s |
| 9B | ≈ 6 GB | 120 ÷ 6 | ≈ 20 Tok/s |
| 14B | ≈ 9 GB | 120 ÷ 9 | ≈ 13 tok/s |
| 24B | ≈ 14 GB | 120 ÷ 14 | ≈ 8 bis 9 Tok/s |
| Dichtes 32B-Modell | ≈ 19 bis 20 GB | 120 ÷ 19,5 | ≈ 6 tok/s |
Zwei praktische Folgen. Ein 8B-Modell in Q4 wird auf diesem Chip etwa 24 Tokens pro Sekunde nicht überschreiten: Eine angegebene Geschwindigkeit von 34 Tokens pro Sekunde für dieses Modell ist ohne eine andere Technik unmöglich. Und ein dichtes 24B-Modell bleibt selbst im besten Fall bei etwa 8 Tokens pro Sekunde, also dem Tempo aufmerksamen Lesens: angenehm für einen in Ruhe gelesenen Text, langsam für einen Agenten, der Aufrufe aneinanderreiht. Für reale Messwerte sehen Sie sich /benchmarks und Quellen von Dritten an, die den Chip und die Quantisierung angeben.
#M4 oder M5: Ändert die nächste Generation die Ausgangslage?
Apple bietet inzwischen ein MacBook Air M5 an. Das Datenblatt nennt eine Bandbreite von 153 GB/s gegenüber 120 GB/s beim M4, also rund 28 % mehr, bei denselben Speicheroptionen von 16, 24 oder 32 GB. Bei einem durch die Bandbreite begrenzten LLM liegt der theoretische Unterschied bei der maximalen Geschwindigkeit in derselben Größenordnung: Ein 8B-Modell in Q4 würde im besten Fall von etwa 24 auf etwa 30 Tokens pro Sekunde kommen.
| Kriterium | Air M4 | Air M5 |
|---|---|---|
| Bandbreite | 120 GB/s | 153 GB/s |
| Speicher | 16, 24 oder 32 GB | 16, 24 oder 32 GB |
| Theoretischer Grenzwert 8B Q4 | ≈ 24 Tok/s | ≈ 30 tok/s |
Beim Speicher hingegen ändert sich nichts: Ein Air M5 mit 16 GB kann nicht mehr Modelle ausführen als ein Air M4 mit 16 GB. Wenn Sie einen M4 mit 24 oder 32 GB finden, ist er hinsichtlich der möglichen Modellgröße besser als ein M5 mit 16 GB; bei gleicher Speicherkapazität ist der M5 schneller. Vergleichen Sie die aktuellen Preise im Handel, sie schwanken zu stark, um sie hier anzugeben.
#Installation und Auswahl der Engine
- 01Ollama installierenLaden Sie es über ollama.com oder mit Homebrew herunter. Die Installationsanleitung für macOS beschreibt den automatischen Start.
- 02Ein Modell passend zur Speichergröße starten9B auf 16 GB, 24B in Q4 auf 24 GB, ein MoE von 30B auf 32 GB. Der erste Start lädt das Modell herunter.
- 03GPU überprüfenollama ps affiche la répartition CPU/GPU dans la colonne PROCESSOR : tout sur le GPU est l'état attendu.
- 04Kontext einstellenBei weniger als 24 GiB Speicher setzt Ollama das Kontextfenster standardmäßig auf 4.000 Tokens. Vergrößern Sie es nach Bedarf; der KV-Cache wächst dabei mit.
MLX, das Framework von Apple, nutzt den gemeinsamen Speicher des Macs, ohne Daten zwischen CPU und GPU zu kopieren; LM Studio bietet es in Form von MLX-Modellen an. Beide Wege funktionieren: Ollama für eine einfache Nutzung und die lokale API, MLX und LM Studio zum Erkunden der Apple-Formate. Der Leitfaden „MLX vs. llama.cpp“ vergleicht die beiden Ansätze, ohne dass seine Schlussfolgerungen hier wiederholt werden müssen.
#Langer Kontext und GPU-Speicherbegrenzung
Das Modell macht nur einen Teil des Speicherbedarfs aus: Jedes Kontexttoken fügt dem KV-Cache einen Eintrag hinzu, und macOS begrenzt den tatsächlich für die GPU verfügbaren Speicher. Ollama nutzt automatisch Flash Attention, wenn Engine und Hardware dies ermöglichen, und erlaubt die Quantisierung des KV-Caches über die Variable OLLAMA_KV_CACHE_TYPE (standardmäßig f16). Bei 16 GB macht diese Einstellung oft den Unterschied zwischen einem kurzen Kontext und einem Kontext mit mehreren Tausend Tokens aus.
Bei MLX weist das Repository mlx-lm darauf hin, dass sich ein Modell, das in den Speicher passt, oft beschleunigen lässt, indem man die systemweite Grenze für nicht auslagerbaren Speicher über eine sysctl-Einstellung erhöht. Das ist eine Systemänderung: Sie erfordert Administratorrechte, bleibt nach einem Neustart nicht unbedingt erhalten und kann den Rechner destabilisieren, wenn der Wert zu hoch ist. Der Leitfaden zur macOS-Optimierung erläutert das Vorgehen und einen angemessenen Wert je nach Speicherausstattung; ändern Sie diese Grenze nicht, ohne ihn gelesen zu haben.
#Air M4, MacBook Pro oder Mac mini: Welches Gerät für welchen Einsatzzweck?
Das Air M4 punktet mit geringem Gewicht und lautlosem Betrieb, hat aber keinen Lüfter: Bei längerer Belastung sinkt die Taktfrequenz des Chips. Das MacBook Pro mit M4 Pro oder Max bietet zusätzlich Lüfter, eine Speicherbandbreite von 273 bis 546 GB/s und laut Apple-Datenblatt bis zu 128 GB Speicher; der Mac mini M4 ist ein stationärer, aktiv gekühlter Rechner.
| Ihr Bedarf | Geeigneter Rechner | Warum |
|---|---|---|
| Chat, Zusammenfassungen, einfache Programmieraufgaben, mobile Nutzung | Air M4 16 oder 24 GB | Leiser Betrieb, Akkulaufzeit, Modelle mit 8 bis 14 Milliarden Parametern |
| Modelle mit 24 bis 32 Milliarden Parametern, langer Kontext | Air M4 mit 32 GB oder Mac mini | Ausreichend Arbeitsspeicher; Mac mini, wenn das Gerät im Büro bleibt |
| Lange Verarbeitungsvorgänge, mehrere Modelle | MacBook Pro M4 Pro oder Max, Mac mini | Aktive Kühlung, höhere Bandbreite |
| Modelle mit 70 Milliarden Parametern | MacBook Pro Max oder Mac Studio | Ein 70B-Modell benötigt in Q4 etwa 40 GB: zu viel für ein Air |
- MacBook Pro M4 Pro und Max: 273 bis 546 GB/s
- Mac mini M4 und M4 Pro für ein LLM
- MacBook Air M2: 100 GB/s, maximal 24 GB
- MLX vs. llama.cpp auf dem Mac
- Einen Mac mit Apple Silicon für LLMs optimieren
- Welcher LLM für 16 GB Speicher?
- Quelle: technische Spezifikationen von Apple für das MacBook Air M4
- Quelle: Apples technische Daten zum aktuellen MacBook Air
- Quelle: technische Spezifikation Apple des MacBook Pro M4 Pro und Max
- Quelle: Ollama-Dokumentation, Kontext
#Einschränkungen, die Sie kennen sollten
- Länger anhaltende Last
- Ohne Lüfter sinkt bei einer kontinuierlichen Generierung über mehrere Dutzend Minuten irgendwann die Taktfrequenz. Beim Chatten fällt der Effekt nicht auf; für die Indexierung oder Stapelverarbeitung ist ein Rechner mit Lüfter besser geeignet.
- Keine 70B-Modelle
- Ein 70B-Modell benötigt in Q4 etwa 40 GB: mehr als die maximal 32 GB des Air.
- Die Neural Engine beschleunigt Ollama nicht
- Die gängigen Engines nutzen die GPU über Metal. Die NPU kommt nur bei bestimmten Anwendungen mit Core ML zum Einsatz.
- Speicher
- Die Modelle belegen jeweils mehrere Gigabyte im Modellverzeichnis von Ollama: Eine SSD mit 256 GB füllt sich mit mehreren Modellen von jeweils 5 bis 15 GB schnell.
#Häufig gestellte Fragen
Reicht ein MacBook Air M4 mit 16 GB für einen lokalen LLM aus?+
Wie viel VRAM hat ein MacBook Air M4?+
Welche Geschwindigkeit kann ein 8B-Modell auf dem MacBook Air M4 erzielen?+
Kann ein Modell mit 30 Milliarden Parametern auf einem Air M4 ausgeführt werden?+
Sollte man für lokale KI auf das Air M5 warten?+
Wird das MacBook Air M4 beim Betrieb eines LLM warm?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.