Einsteiger 11 Min.MacBook Air

Welcher LLM für MacBook Air M3 (8 / 16 / 24 GB) ?

Direkte Antwort

Lokale KI auf dem MacBook Air M3: Mit 16 GB vereinheitlichtem Speicher läuft ein Modell mit 8 bis 9 Milliarden Parametern in Q4 problemlos; mit 8 GB bleiben Sie bei 3–4B; mit 24 GB lässt sich ein 24B-Modell laden, aber die Bandbreite von 100 GB/s macht es langsam. Der M3 ist bei der Textgenerierung nicht schneller als der M2: Die veröffentlichten Messungen zeigen nahezu identische Durchsatzraten. Verwechseln Sie das nicht mit Apple Intelligence, einem anderen Dienst.

Das MacBook Air M3 ist der am weitesten verbreitete Apple-Laptop zum Testen lokaler KI. Es ist leise, hat keinen Lüfter und führt Modelle mit 8 bis 9 Milliarden Parametern problemlos aus. Hier erfahren Sie, was jede Speicherkonfiguration ermöglicht, was die veröffentlichten Messungen über die Geschwindigkeit aussagen, was sich seit dem M2 nicht geändert hat und welche Einstellungen wirklich zählen.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Getestet auf macOS 14+
Empfohlene Hardware

Kaufalternative für diesen Guide: MacBook Pro M5 Pro — 24 GB / 1 TB.

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.

#MacBook Air M3 im Jahr 2026: die für LLMs relevanten technischen Daten

Laut Apples technischen Daten kombiniert der M3-Chip des MacBook Air eine CPU mit 8 Kernen (4 Performance- und 4 Effizienzkerne), eine GPU mit 8 oder 10 Kernen, eine Neural Engine mit 16 Kernen und eine Speicherbandbreite von 100 GB/s. Der gemeinsame Speicher ist fest verlötet: Apple nennt zwei Einstiegskonfigurationen mit 8 GB oder 16 GB, die beide beim Kauf auf 24 GB aufgerüstet werden können. Das Modell ist mit 13 und 15 Zoll und jeweils demselben Chip erhältlich.

Bandbreite
100 GB/s, dieselbe Bandbreite wie beim M2. Sie begrenzt die Generierungsgeschwindigkeit stärker als die Anzahl der GPU-Kerne.
Kühlung
Ohne Lüfter. Der Chip kann seine Wärme nur über das Gehäuse abgeben: Bei einer längeren Generierung senkt er schließlich seine Taktfrequenz.
Neural Engine
16 Kerne, aber die gängigen Tools für lokale KI (Ollama, llama.cpp, LM Studio) nutzen die GPU über Metal, nicht die Neural Engine.
Neuerung beim M3
Dynamic Caching, das den lokalen GPU-Speicher in Echtzeit zuweist. Wir haben keine Messdaten zu dessen Auswirkungen auf LLMs und machen dazu auch keine Versprechungen.
i
Was der M3 nicht verändert hat
Der M3 behält die 100 GB/s des M2 bei. Die Messtabelle von llama.cpp bestätigt dies: Ein Llama 7B in Q4_0 erzeugt auf dem M3 21,34 Tokens pro Sekunde gegenüber 21,91 auf dem M2 (Q8_0: 12,27 gegenüber 12,21). Der Wechsel von einem Air M2 zu einem Air M3 beschleunigt daher die Textgenerierung nicht. Die Bandbreite ändert sich erst mit dem M4 auf 120 GB/s.

#Lokale KI oder Apple Intelligence: zwei verschiedene Dinge

Das Mac-Kit

Lokale KI auf Ihrem Mac voll ausschöpfen: Unified Memory, MLX vs. GGUF, das passende Modell für Ihren Chip und auf Apple Silicon abgestimmte Einstellungen für Ollama und LM Studio.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Viele Suchanfragen zum MacBook Air M3 beziehen sich auf „KI“ im weiteren Sinne. Apple Intelligence ist die in macOS integrierte Sammlung von Funktionen (Zusammenfassungen, Schreiben, Siri); laut Apple funktioniert sie auf Macs mit einem M1-Chip oder neuer, also auch auf dem MacBook Air M3. Sie ermöglicht Ihnen weder, das Modell auszuwählen, noch eine API bereitzustellen oder mit einem offenen Modell Ihre eigenen Dokumente zu bearbeiten.

Lokale KI, um die es in diesem Leitfaden geht, bedeutet, ein offenes Modell (Qwen, Gemma, Granite, Mistral) herunterzuladen und mit Ollama, LM Studio oder MLX auszuführen. Sie entscheiden über das Modell, die Kontextgröße und darüber, was auf dem Rechner bleibt. Beides kann nebeneinander bestehen; der Arbeitsspeicher wird jedoch gemeinsam genutzt, und ein geladenes Modell mit 9 Milliarden Parametern reduziert den Speicher, der für macOS und die Anwendungen übrig bleibt.

#Wie viel Speicher: 8, 16 oder 24 GB

Der Speicher ist das wichtigste Kriterium, denn ein Modell, das die verfügbare Speicherkapazität überschreitet, wird nicht langsamer: Es wird unbrauchbar. Auf Apple Silicon kann die GPU nicht den gesamten vereinheitlichten Speicher nutzen; laut den Diskussionen im llama.cpp-Repository stellt Metal ihr standardmäßig zwischen zwei Dritteln und drei Vierteln davon zur Verfügung. Rechnen Sie bei einem Gerät mit 16 GB mit etwa 10 bis 12 GB für das Modell und seinen Kontext.

Was jede Konfiguration ermöglicht (Q4-Modellgrößen aus dem QuelLLM-Katalog)
SpeicherFür das Modell nutzbar (Schätzung)Was mit ausreichend Spielraum hineinpasstWas gerade noch in den Speicher passt
8 GB5 bis 6 GBQwen 3.5 4B (2,3 GB), Gemma 4 2B (1,2 GB)Granite 4.2 8B (4,6 GB), kurzer Kontext
16 GB10 bis 12 GBQwen 3.5 9B (6 GB), Granite 4.2 8B, Gemma 4 12B (7 GB)Modelle ab 14 GB: nein
24 GB16 bis 18 GBQwen 3.5 9B in Q8, Gemma 4 12B, Modelle mit 14 bis 16 GBMistral Small 3.2 24B (14 GB) oder Qwen 3.5 27B (16 GB): lassen sich laden, laufen aber langsam

Die Spalte „nutzbar“ ist eine Schätzung anhand der Zwei-Drittel- bis Drei-Viertel-Regel, keine Angabe von Apple. Die 8-GB-Variante ist nur sinnvoll, wenn Sie wissen, dass Sie bei kleinen Modellen bleiben werden; da sich der Arbeitsspeicher später nicht erweitern lässt, ist die 16-GB-Variante die vernünftige Wahl für lokale KI. Um zu prüfen, ob ein Modell samt Kontext in den Speicher passt, liefert der Speicherrechner dieser Website den Gesamtbedarf.

#Welches Modell wählen und welche Geschwindigkeit erwarten?

Der Generierungsdurchsatz wird durch die Bandbreite geteilt durch die Größe der bei jedem Token gelesenen Gewichte begrenzt. Bei 100 GB/s liegt die Obergrenze für ein 4,6-GB-Modell bei etwa 21 Tokens pro Sekunde, für ein 6-GB-Modell bei etwa 16 und für ein 14-GB-Modell bei etwa 7. In den veröffentlichten Messungen für ein Llama 7B erreicht der M3 in Q4_0 21,34 Tokens pro Sekunde, also etwa 80 % der Obergrenze. Es handelt sich um theoretische Obergrenzen, nicht um Garantien.

Theoretische Obergrenze bei 100 GB/s je nach Größe der Modellgewichte
Modell (Q4)ModellgrößeObergrenze (100 ÷ Größe der Gewichte)Zusammenfassung
Qwen 3.5 4B2,3 GBetwa 43 t/sSehr flüssig, kurze und schnelle Antworten
Granite 4.2 8B4,6 GBetwa 21 t/sGuter Kompromiss für Chat und Zusammenfassungen
Qwen 3.5 9B6 GBca. 16 t/sDie Wahl für Qualität bei 16 GB
Gemma 4 12B7 GBetwa 14 t/sLäuft ordentlich mit 16 GB und moderatem Kontext
Mistral Small 3.2 24B14 GBca. 7 t/sLesbar, aber kein interaktiver Einsatz mehr
Qwen 3.5 27B16 GBetwa 6 t/sNur für lange Aufgaben auf einem Rechner mit 24 GB verwenden

Wenn das Ergebnis zu langsam ist, liegt der Hebel nicht bei einer Einstellung, sondern bei der Modellgröße: Ein Wechsel von 9B auf 4B verdoppelt ungefähr den Durchsatz. Für Code ist ein spezialisiertes Modell mit 7 bis 9B nützlicher als ein 24B-Modell, das für den Einsatz in Echtzeit zu langsam ist. Die Geschwindigkeitstabelle auf der Website (/benchmarks) enthält die je nach Hardware veröffentlichten Messwerte.

#Ohne Lüfter: Die Hitze begrenzt lange Generierungen

Das MacBook Air hat keinen Lüfter. Bei einer kurzen Frage werden Sie das nicht bemerken. Beim Zusammenfassen mehrerer Dutzend Seiten oder bei einer mehrminütigen Generierung erwärmt sich der Chip und senkt schließlich seine Taktfrequenz und damit seinen Durchsatz. Das Phänomen hängt vom Raum, der Last und der Umgebung ab; wir haben keine Messung, die wir dazu anführen können, und Sie sollten es auf Ihrem Rechner mit einer längeren Generierung überprüfen.

Den Rechner auf eine Unterlage stellen, die eine gute Belüftung ermöglicht
Ein Aluminiumständer oder eine harte Oberfläche hilft dem Gehäuse, Wärme abzuführen; ein Sofa oder ein Bett verhindert dies.
Pausen planen
Teilen Sie bei langen Aufgaben die Arbeit in mehrere Teilaufgaben auf, statt alles in einem einzigen, mehrere Minuten dauernden Generierungslauf zu erledigen.
Ein kleineres Modell verwenden
Ein 4B- oder 8B-Modell erzeugt deutlich weniger Wärme als ein Modell, das die Bandbreite ständig vollständig auslastet.
An den Netzstrom anschließen
Im Akkubetrieb kann macOS die Leistung begrenzen, um Energie zu sparen.

#Ollama installieren und erstes Modell starten

Ollama erfordert macOS Sonoma (14) oder neuer. Am einfachsten ist es, die Anwendung von der offiziellen Website herunterzuladen; die Installationsanleitung beschreibt die Homebrew-Variante im Detail. Nach dem Start lauscht die Anwendung auf Port 11434 des Rechners, und die Modelle lassen sich mit einem einzigen Befehl herunterladen.

  1. 01
    Ollama installieren
    Laden Sie die Anwendung herunter oder folgen Sie der Installationsanleitung für macOS, dann starten Sie sie erstmals.
  2. 02
    Ein Modell nach der Speichergröße auswählen
    8 GB: ein Modell mit 3 bis 4 Milliarden Parametern. 16 GB: ein 8B (5,2 GB in der Bibliothek Ollama). 24 GB: ein 14B (9,3 GB) oder größer.
  3. 03
    Generierung starten
    Führen Sie ollama run gefolgt vom Modellnamen aus: Der Download erfolgt beim ersten Aufruf.
  4. 04
    Die Speicherbelegung während der Nutzung überprüfen
    Öffnen Sie die Aktivitätsanzeige und wechseln Sie zum Tab „Speicher“: Die Speicherdruckanzeige muss grün bleiben. Wenn sie gelb oder rot wird, ist das Modell zu groß oder der Kontext zu lang.
Erstes Modell auf 16 GB
ollama run qwen3:8b

Die Ollama-Bibliothek gibt 5,2 GB für qwen3:8b und 9,3 GB für qwen3:14b an. Das zweite Modell eignet sich für ein MacBook Air mit 24 GB, nicht für eines mit 16 GB, auf dem es zu wenig Speicherreserven lässt. Wenn Sie MLX statt Ollama testen möchten, erklärt der entsprechende Leitfaden den Unterschied und die Grenzen der beiden Tools.

#Zwei Ollama-Einstellungen, die bei 16 GB wichtig sind

Der erste Faktor ist die Kontextgröße. Die offizielle FAQ von Ollama nennt ein standardmäßiges Kontextfenster von 4.096 Tokens, das sich ändern lässt; eine Vergrößerung benötigt Speicher für den Cache. Bei langen Dokumenten sollten Sie es schrittweise vergrößern, statt einen Maximalwert festzulegen. Der zweite Faktor ist die Quantisierung des KV-Caches: Laut derselben FAQ unterstützt Ollama die Variable OLLAMA_KV_CACHE_TYPE mit dem Wert q8_0. Dieses Format benötigt etwa halb so viel Speicher wie das standardmäßige f16-Format, sofern Flash Attention aktiviert ist.

Den Kontextcache halbieren
launchctl setenv OLLAMA_FLASH_ATTENTION 1
launchctl setenv OLLAMA_KV_CACHE_TYPE q8_0
# puis quitter et relancer l'application Ollama

Auf dem Mac erläutert die FAQ, dass die Variablen mit launchctl gesetzt werden, wenn Ollama als App läuft, und die App anschließend neu gestartet werden muss. Der Optimierungsleitfaden für Macs mit Apple Silicon ergänzt diese Einstellungen auf macOS-Ebene.

#MLX oder Ollama auf MacBook Air M3

MLX ist Apples Machine-Learning-Framework für seine Chips. Es eignet sich für Entwickler, die das Modell von Python aus steuern oder lokal ein LoRA-Fine-Tuning durchführen möchten. Ollama hingegen übernimmt das Herunterladen, das Laden und die API; es ist der einfachste Einstieg. Die Geschwindigkeitsunterschiede zwischen den beiden hängen vom Modell und der Version ab: Statt einen Prozentsatz zu versprechen, verweisen wir auf den ausführlichen Vergleich auf dieser Website.

#Sollten Sie auf ein MacBook Air M4 oder neuer umsteigen?

Laut der Tabelle von llama.cpp erhöht der M4 die Bandbreite auf 120 GB/s, also um 20 % gegenüber dem M3: In dieser Tabelle steigt die Geschwindigkeit eines Llama 7B in Q4_0 von 21,34 auf 24,11 Tokens pro Sekunde. Bei Modellen ab 8B ist das spürbar, aber kein grundlegender Unterschied. Die eigentliche Grenze des M3 bleibt die Speicherkapazität, nicht die Geschwindigkeit.

Wann behält man den Air M3, wann wechselt man?
Ihre SituationEmpfehlung
Air M3 mit 16 GB, Chat und Zusammenfassungen mit 8B- bis 9B-ModellenBehalten Sie ihn: Ein M4 bietet etwa 20 % mehr Durchsatz.
Air M3 8 GB, Interesse an Modellen ab 8BWechseln Sie zu einem Modell mit mindestens 16 GB: Der Speicher ist der begrenzende Faktor
Bedarf, ein Modell mit 24 bis 32 Milliarden Parametern komfortabel zu betreibenEin Mac mit höherer Bandbreite und mehr Speicher (MacBook Pro, Mac mini M4 Pro)
Lange Generierungen ohne UnterbrechungEin Mac mit Lüfter, um eine Absenkung der Taktfrequenz zu vermeiden

#Häufig gestellte Fragen

FAQ
Kann das MacBook Air M3 ein LLM mit 70 Milliarden Parametern ausführen?+
Nein, nicht in sinnvoll nutzbarer Weise. Ein 70B-Modell in Q4 benötigt etwa 40 GB, also deutlich mehr als die maximalen 24 GB des MacBook Air M3. Selbst mit sehr aggressiver Quantisierung würde es nicht in den Speicher passen. Die sinnvolle Obergrenze auf diesem Rechner ist bei 24 GB ein Modell mit 24 bis 27 Milliarden Parametern, das langsam läuft, und bei 16 GB ein Modell mit 8 bis 9 Milliarden Parametern für eine flüssige Nutzung.
Welche Geschwindigkeit kann man auf einem MacBook Air M3 erwarten?+
Für ein Llama 7B in Q4_0 gibt die Messtabelle von llama.cpp 21,34 Tokens pro Sekunde auf einem M3 mit 10 GPU-Kernen an. Ein größeres Modell ist langsamer, ein 4B-Modell etwa doppelt so schnell. Es handelt sich um Messungen von Nutzern mit einem älteren Modell, die als grober Orientierungswert zu verstehen sind.
MacBook Air M3 8 GB oder MacBook Air M2 16 GB für lokale KI?+
Den M2 mit 16 GB, ohne zu zögern. Beide Chips haben dieselbe Bandbreite von 100 GB/s, daher generiert der M3 nicht schneller. Mit 16 GB lässt sich jedoch ein Modell mit 8–9 Milliarden Parametern laden, das in 8 GB nicht bequem Platz findet. Die Speicherkapazität ist der entscheidende Faktor.
Kann man die Neural Engine für die Ausführung von LLMs verwenden?+
Nicht mit den gängigen Tools. Ollama, llama.cpp und LM Studio führen das Modell über Metal auf der GPU aus. Die Neural Engine mit 16 Kernen dient vor allem Core-ML-Aufgaben wie Bildverarbeitung oder Spracherkennung und ist nicht der Weg, um ein Chat-LLM auf diesem Mac zu beschleunigen.
Wird das MacBook Air M3 bei lokaler KI zu heiß?+
Es hat keinen Lüfter und senkt deshalb bei längeren Generierungen schließlich seine Taktfrequenz. Bei kurzen Fragen werden Sie das nicht bemerken. Stellen Sie es für längere Aufgaben auf eine Unterlage, die Wärme ableitet, schließen Sie es an die Stromversorgung an und wählen Sie ein kleineres Modell. Für den Dauerbetrieb ist ein Gerät mit Lüfter vorzuziehen.
Welches Modell zum Programmieren auf einem MacBook Air M3 mit 16 GB?+
Ein Code-Modell mit 7 bis 9 Milliarden Parametern in Q4, etwa 5 bis 6 GB, lässt Platz für den Kontext Ihrer Dateien. Ein 14B-Modell in Q4 (etwa 9 GB) kommt infrage, wenn Sie einen geringeren Durchsatz akzeptieren. Bei größeren Modellen verbraucht ein langer Kontext den verbleibenden Spielraum, und die Geschwindigkeit wird für eine unterstützte Texteingabe zu niedrig.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.