Einsteiger 11 Min.MacBook Air

Welcher LLM für MacBook Air M4 (16 / 24 / 32 GB) ?

Direkte Antwort

Das MacBook Air M4 führt Modelle mit 8 bis 12 Milliarden Parametern mit 16 GB, ein 24B-Modell in Q4 mit 24 GB und ein MoE-Modell mit 30B mit 32 GB problemlos aus. Seine Speicherbandbreite von 120 GB/s begrenzt ein 8B-Modell in Q4 auf etwa 24 Tokens pro Sekunde; der nicht erweiterbare Arbeitsspeicher bestimmt die Modellgröße.

Der M4 ist der erste Air, dessen Speicherausstattung bei 16 GB beginnt und bis zu 32 GB reicht. Diese Seite zeigt, welche Speicherausstattung Sie wählen sollten, berechnet die maximale Geschwindigkeit, die der Chip erreichen kann, vergleicht ihn mit dem Air M5, dem MacBook Pro und dem Mac mini und zeigt die Grenzen des Air auf.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-29·Getestet auf macOS 14+
Empfohlene Hardware

Kaufalternative für diesen Guide: MacBook Pro M5 Pro — 24 GB / 1 TB.

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#MacBook Air M4: 120 GB/s und bis zu 32 GB Speicher

Das MacBook Air M4 ist das erste Air, dessen Basiskonfiguration 16 GB vereinheitlichten Speicher bietet und das mit bis zu 32 GB erhältlich ist, bei einer Bandbreite von 120 GB/s. Für ein LLM zählen diese beiden Werte mehr als die Anzahl der Kerne: Der Speicher bestimmt die Größe des Modells, das geladen werden kann, die Bandbreite dessen maximale Geschwindigkeit. Bei 120 GB/s überschreitet ein Modell mit 8 Milliarden Parametern in Q4 theoretisch nicht 24 Tokens pro Sekunde; die tatsächliche Geschwindigkeit ist niedriger.

Chip
Apple M4: CPU mit 10 Kernen (4 Performance-Kerne, 6 Effizienzkerne), GPU mit 8 oder 10 Kernen, Neural Engine mit 16 Kernen, laut Apples technischen Daten.
Speicher
Standardmäßig 16 GB, auf 24 oder 32 GB konfigurierbar. Der Arbeitsspeicher ist verlötet: Die Konfiguration wird beim Kauf gewählt.
Bandbreite
120 GB/s laut dem Datenblatt von Apple, also 20 % mehr als die 100 GB/s des Air M3.
Neural Engine
Apple gibt für den M4 bis zu 38.000 Milliarden Operationen pro Sekunde an. Die gängigen Engines (Ollama, llama.cpp) laufen hauptsächlich über Metal auf der GPU; diese Zahl lässt sich daher nicht in Tokens pro Sekunde umrechnen.
Kühlung
Ohne Lüfter: Die Wärme wird über das Gehäuse abgeführt, was sehr lange Lastphasen begrenzt.

Auf einem Mac gibt es keinen separaten VRAM: Die GPU nutzt den vereinheitlichten Speicher. Wenn man nach „VRAM des MacBook Air M4“ sucht, lautet die praktische Antwort: der gesamte Speicher abzüglich des für das System reservierten Anteils, begrenzt durch die Obergrenze, die macOS der GPU erlaubt. Diese Grenze lässt sich anpassen; der Leitfaden zur macOS-Optimierung auf dieser Website erklärt, wie das geht und welche Risiken damit verbunden sind.

#16, 24 oder 32 GB: die Speichergröße wählen

Das Mac-Kit

Lokale KI auf Ihrem Mac voll ausschöpfen: Unified Memory, MLX vs. GGUF, das passende Modell für Ihren Chip und auf Apple Silicon abgestimmte Einstellungen für Ollama und LM Studio.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Das Modell, sein Kontext und das System teilen sich den Speicher. Die folgenden Spielräume sind vorsichtige Schätzungen, die mit dem Speicherdruck in der Aktivitätsanzeige abgeglichen werden sollten: etwa 11 bis 12 GB für ein Modell bei insgesamt 16 GB Speicher, 17 bis 19 GB bei 24 GB und 24 bis 26 GB bei 32 GB. Die Modellgrößen entsprechen den Richtwerten der Website: 8B etwa 5 GB, 14B etwa 9 GB, 24B etwa 14 GB, 32B etwa 19 bis 20 GB in Q4.

MacBook Air M4: Modellklasse nach Speicher (Q4_K_M)
SpeicherGeschätzte SpeicherreserveModellklasse mit ausreichend SpielraumAn der Grenze
16 GB≈ 11 bis 12 GB8-9B mit mittlerem Kontext, 12B in Q414B in Q4 mit kurzem Kontext
24 GB≈ 17 bis 19 GB12-14B komfortabel, 24B in Q4 (≈ 14 GB)27B in Q4 (≈ 16 GB) mit reduziertem Kontext
32 GB≈ 24 bis 26 GB24B in Q5–Q6, 27B in Q4, MoE-Modelle mit 30BDichtes 32B-Modell in Q4 (≈ 19–20 GB) mit langem Kontext
i
Die sinnvolle Speicherstufe hängt von der Modellgeneration ab
Mixture-of-Experts-Modelle (MoE) verändern die Berechnung: Ein 30B-Modell, bei dem 3B aktiv sind, belegt etwa 19 GB Speicher, liest aber bei jedem Token nur einen kleinen Bruchteil der Gewichte erneut ein. Mit 32 GB läuft es deutlich schneller als ein dichtes Modell mit gleich großen Modellgewichten. Mit 16 GB lässt es sich nicht laden: Der Speicher bleibt das erste Auswahlkriterium.

Die Frage ist daher, welche Modellgröße Sie anstreben. Wenn Sie sich auf Modelle mit 8 bis 12 Milliarden Parametern beschränken, reichen 16 GB aus. Für 24B-Modelle oder für RAG mit parallel laufendem Embedder und Reranker sind 24 GB die erste komfortable Speicherstufe. Mit 32 GB gewinnen Sie vor allem Spielraum für langen Kontext und 30B-MoE-Modelle.

#Die maximale Geschwindigkeit bei 120 GB/s

Das Prinzip: Jedes generierte Token erfordert das Lesen der aktiven Gewichte. Die Obergrenze ergibt sich aus der Bandbreite geteilt durch die Größe der Gewichte in Gigabyte. Die Tabelle wendet diese Formel auf den M4 (120 GB/s) an. Das sind berechnete Obergrenzen, keine Messwerte: Die tatsächliche Geschwindigkeit hängt von der Inferenz-Engine, der Quantisierung, dem Kontext und der Temperatur des Chips ab.

Theoretischer Maximalwert für die Generierung auf Air M4 (120 GB/s, aktive Gewichtsdaten in Q4): Berechnung, nicht Messung
ModellAktive GewichteBerechnungObergrenze
3B≈ 2 GB120 ÷ 2≈ 60 Tok/s
8B≈ 5 GB120 ÷ 5≈ 24 Tok/s
9B≈ 6 GB120 ÷ 6≈ 20 Tok/s
14B≈ 9 GB120 ÷ 9≈ 13 tok/s
24B≈ 14 GB120 ÷ 14≈ 8 bis 9 Tok/s
Dichtes 32B-Modell≈ 19 bis 20 GB120 ÷ 19,5≈ 6 tok/s

Zwei praktische Folgen. Ein 8B-Modell in Q4 wird auf diesem Chip etwa 24 Tokens pro Sekunde nicht überschreiten: Eine angegebene Geschwindigkeit von 34 Tokens pro Sekunde für dieses Modell ist ohne eine andere Technik unmöglich. Und ein dichtes 24B-Modell bleibt selbst im besten Fall bei etwa 8 Tokens pro Sekunde, also dem Tempo aufmerksamen Lesens: angenehm für einen in Ruhe gelesenen Text, langsam für einen Agenten, der Aufrufe aneinanderreiht. Für reale Messwerte sehen Sie sich /benchmarks und Quellen von Dritten an, die den Chip und die Quantisierung angeben.

#M4 oder M5: Ändert die nächste Generation die Ausgangslage?

Apple bietet inzwischen ein MacBook Air M5 an. Das Datenblatt nennt eine Bandbreite von 153 GB/s gegenüber 120 GB/s beim M4, also rund 28 % mehr, bei denselben Speicheroptionen von 16, 24 oder 32 GB. Bei einem durch die Bandbreite begrenzten LLM liegt der theoretische Unterschied bei der maximalen Geschwindigkeit in derselben Größenordnung: Ein 8B-Modell in Q4 würde im besten Fall von etwa 24 auf etwa 30 Tokens pro Sekunde kommen.

Air M4 und Air M5: Die wichtigen Zahlen für ein LLM, gemäß Apple
KriteriumAir M4Air M5
Bandbreite120 GB/s153 GB/s
Speicher16, 24 oder 32 GB16, 24 oder 32 GB
Theoretischer Grenzwert 8B Q4≈ 24 Tok/s≈ 30 tok/s

Beim Speicher hingegen ändert sich nichts: Ein Air M5 mit 16 GB kann nicht mehr Modelle ausführen als ein Air M4 mit 16 GB. Wenn Sie einen M4 mit 24 oder 32 GB finden, ist er hinsichtlich der möglichen Modellgröße besser als ein M5 mit 16 GB; bei gleicher Speicherkapazität ist der M5 schneller. Vergleichen Sie die aktuellen Preise im Handel, sie schwanken zu stark, um sie hier anzugeben.

#Installation und Auswahl der Engine

  1. 01
    Ollama installieren
    Laden Sie es über ollama.com oder mit Homebrew herunter. Die Installationsanleitung für macOS beschreibt den automatischen Start.
  2. 02
    Ein Modell passend zur Speichergröße starten
    9B auf 16 GB, 24B in Q4 auf 24 GB, ein MoE von 30B auf 32 GB. Der erste Start lädt das Modell herunter.
  3. 03
    GPU überprüfen
    ollama ps affiche la répartition CPU/GPU dans la colonne PROCESSOR : tout sur le GPU est l'état attendu.
  4. 04
    Kontext einstellen
    Bei weniger als 24 GiB Speicher setzt Ollama das Kontextfenster standardmäßig auf 4.000 Tokens. Vergrößern Sie es nach Bedarf; der KV-Cache wächst dabei mit.
Terminal
brew install --cask ollama
ollama run qwen3.5:9b
ollama ps

MLX, das Framework von Apple, nutzt den gemeinsamen Speicher des Macs, ohne Daten zwischen CPU und GPU zu kopieren; LM Studio bietet es in Form von MLX-Modellen an. Beide Wege funktionieren: Ollama für eine einfache Nutzung und die lokale API, MLX und LM Studio zum Erkunden der Apple-Formate. Der Leitfaden „MLX vs. llama.cpp“ vergleicht die beiden Ansätze, ohne dass seine Schlussfolgerungen hier wiederholt werden müssen.

#Langer Kontext und GPU-Speicherbegrenzung

Das Modell macht nur einen Teil des Speicherbedarfs aus: Jedes Kontexttoken fügt dem KV-Cache einen Eintrag hinzu, und macOS begrenzt den tatsächlich für die GPU verfügbaren Speicher. Ollama nutzt automatisch Flash Attention, wenn Engine und Hardware dies ermöglichen, und erlaubt die Quantisierung des KV-Caches über die Variable OLLAMA_KV_CACHE_TYPE (standardmäßig f16). Bei 16 GB macht diese Einstellung oft den Unterschied zwischen einem kurzen Kontext und einem Kontext mit mehreren Tausend Tokens aus.

Bei MLX weist das Repository mlx-lm darauf hin, dass sich ein Modell, das in den Speicher passt, oft beschleunigen lässt, indem man die systemweite Grenze für nicht auslagerbaren Speicher über eine sysctl-Einstellung erhöht. Das ist eine Systemänderung: Sie erfordert Administratorrechte, bleibt nach einem Neustart nicht unbedingt erhalten und kann den Rechner destabilisieren, wenn der Wert zu hoch ist. Der Leitfaden zur macOS-Optimierung erläutert das Vorgehen und einen angemessenen Wert je nach Speicherausstattung; ändern Sie diese Grenze nicht, ohne ihn gelesen zu haben.

Terminal
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_FLASH_ATTENTION=1
ollama serve

#Air M4, MacBook Pro oder Mac mini: Welches Gerät für welchen Einsatzzweck?

Das Air M4 punktet mit geringem Gewicht und lautlosem Betrieb, hat aber keinen Lüfter: Bei längerer Belastung sinkt die Taktfrequenz des Chips. Das MacBook Pro mit M4 Pro oder Max bietet zusätzlich Lüfter, eine Speicherbandbreite von 273 bis 546 GB/s und laut Apple-Datenblatt bis zu 128 GB Speicher; der Mac mini M4 ist ein stationärer, aktiv gekühlter Rechner.

Je nach Anwendung wählen
Ihr BedarfGeeigneter RechnerWarum
Chat, Zusammenfassungen, einfache Programmieraufgaben, mobile NutzungAir M4 16 oder 24 GBLeiser Betrieb, Akkulaufzeit, Modelle mit 8 bis 14 Milliarden Parametern
Modelle mit 24 bis 32 Milliarden Parametern, langer KontextAir M4 mit 32 GB oder Mac miniAusreichend Arbeitsspeicher; Mac mini, wenn das Gerät im Büro bleibt
Lange Verarbeitungsvorgänge, mehrere ModelleMacBook Pro M4 Pro oder Max, Mac miniAktive Kühlung, höhere Bandbreite
Modelle mit 70 Milliarden ParameternMacBook Pro Max oder Mac StudioEin 70B-Modell benötigt in Q4 etwa 40 GB: zu viel für ein Air

#Einschränkungen, die Sie kennen sollten

Länger anhaltende Last
Ohne Lüfter sinkt bei einer kontinuierlichen Generierung über mehrere Dutzend Minuten irgendwann die Taktfrequenz. Beim Chatten fällt der Effekt nicht auf; für die Indexierung oder Stapelverarbeitung ist ein Rechner mit Lüfter besser geeignet.
Keine 70B-Modelle
Ein 70B-Modell benötigt in Q4 etwa 40 GB: mehr als die maximal 32 GB des Air.
Die Neural Engine beschleunigt Ollama nicht
Die gängigen Engines nutzen die GPU über Metal. Die NPU kommt nur bei bestimmten Anwendungen mit Core ML zum Einsatz.
Speicher
Die Modelle belegen jeweils mehrere Gigabyte im Modellverzeichnis von Ollama: Eine SSD mit 256 GB füllt sich mit mehreren Modellen von jeweils 5 bis 15 GB schnell.

#Häufig gestellte Fragen

FAQ
Reicht ein MacBook Air M4 mit 16 GB für einen lokalen LLM aus?+
Ja, für Modelle mit 8 bis 12 Milliarden Parametern in Q4, die 5 bis 8 GB belegen und Spielraum für das System und den Kontext lassen. Ein Modell mit 14 Milliarden Parametern passt mit einem kurzen Kontext. Für ein 24B-Modell oder ein speicherintensives RAG sollten Sie 24 oder 32 GB anpeilen, da der Speicher nicht erweiterbar ist.
Wie viel VRAM hat ein MacBook Air M4?+
Kein separater VRAM: Die GPU teilt sich den vereinheitlichten Speicher mit dem Prozessor, je nach Konfiguration 16, 24 oder 32 GB. macOS begrenzt den Anteil, den die GPU reservieren kann, sodass das geladene Modell nicht den gesamten Speicher belegen kann. Der Leitfaden zur macOS-Optimierung erklärt, wie sich diese Grenze erhöhen lässt.
Welche Geschwindigkeit kann ein 8B-Modell auf dem MacBook Air M4 erzielen?+
Die theoretische Obergrenze ergibt sich aus 120 GB/s geteilt durch etwa 5 GB, also maximal 24 Tokens pro Sekunde für ein 8B-Modell in Q4. Die tatsächliche Geschwindigkeit ist niedriger und hängt von der Inferenz-Engine und vom Kontext ab. Ein angegebener Durchsatz deutlich über dieser Obergrenze sollte skeptisch machen.
Kann ein Modell mit 30 Milliarden Parametern auf einem Air M4 ausgeführt werden?+
Nur mit 32 GB, und vorzugsweise mit einem Expertenmodell, bei dem nur wenige Parameter aktiv sind. Ein 30B-Modell benötigt in Q4 etwa 19 GB: Es passt in den verfügbaren Speicher von 24 bis 26 GB, aber ein dichtes 30B-Modell bleibt langsam und erreicht bestenfalls etwa 6 Tokens pro Sekunde. Mit 16 GB lässt es sich nicht laden.
Sollte man für lokale KI auf das Air M5 warten?+
Der M5 bietet 153 GB/s gegenüber 120 GB/s, also etwa 28 % mehr Bandbreite, aber dieselben Speicheroptionen mit 16, 24 oder 32 GB. Wenn Sie bei gleichem Budget einen M4 mit mehr Speicher als einen M5 finden, geben Sie dem Speicher Vorrang: Er bestimmt die Modellgröße.
Wird das MacBook Air M4 beim Betrieb eines LLM warm?+
Es hat keinen Lüfter, erwärmt sich daher und senkt bei anhaltender Last seine Taktfrequenz. Bei kurzen Dialogen ist der Effekt gering. Schließen Sie es bei längeren Verarbeitungsvorgängen an das Stromnetz an, stellen Sie das Gerät erhöht auf und wählen Sie ein kleineres Modell. Für Dauerlast sollten Sie einen Mac mini oder ein MacBook Pro bevorzugen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.