Welcher LLM für MacBook Air M3 (8 / 16 / 24 GB) ?
Lokale KI auf dem MacBook Air M3: Mit 16 GB vereinheitlichtem Speicher läuft ein Modell mit 8 bis 9 Milliarden Parametern in Q4 problemlos; mit 8 GB bleiben Sie bei 3–4B; mit 24 GB lässt sich ein 24B-Modell laden, aber die Bandbreite von 100 GB/s macht es langsam. Der M3 ist bei der Textgenerierung nicht schneller als der M2: Die veröffentlichten Messungen zeigen nahezu identische Durchsatzraten. Verwechseln Sie das nicht mit Apple Intelligence, einem anderen Dienst.
Das MacBook Air M3 ist der am weitesten verbreitete Apple-Laptop zum Testen lokaler KI. Es ist leise, hat keinen Lüfter und führt Modelle mit 8 bis 9 Milliarden Parametern problemlos aus. Hier erfahren Sie, was jede Speicherkonfiguration ermöglicht, was die veröffentlichten Messungen über die Geschwindigkeit aussagen, was sich seit dem M2 nicht geändert hat und welche Einstellungen wirklich zählen.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: MacBook Pro M5 Pro — 24 GB / 1 TB.
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.
#MacBook Air M3 im Jahr 2026: die für LLMs relevanten technischen Daten
Laut Apples technischen Daten kombiniert der M3-Chip des MacBook Air eine CPU mit 8 Kernen (4 Performance- und 4 Effizienzkerne), eine GPU mit 8 oder 10 Kernen, eine Neural Engine mit 16 Kernen und eine Speicherbandbreite von 100 GB/s. Der gemeinsame Speicher ist fest verlötet: Apple nennt zwei Einstiegskonfigurationen mit 8 GB oder 16 GB, die beide beim Kauf auf 24 GB aufgerüstet werden können. Das Modell ist mit 13 und 15 Zoll und jeweils demselben Chip erhältlich.
- Bandbreite
- 100 GB/s, dieselbe Bandbreite wie beim M2. Sie begrenzt die Generierungsgeschwindigkeit stärker als die Anzahl der GPU-Kerne.
- Kühlung
- Ohne Lüfter. Der Chip kann seine Wärme nur über das Gehäuse abgeben: Bei einer längeren Generierung senkt er schließlich seine Taktfrequenz.
- Neural Engine
- 16 Kerne, aber die gängigen Tools für lokale KI (Ollama, llama.cpp, LM Studio) nutzen die GPU über Metal, nicht die Neural Engine.
- Neuerung beim M3
- Dynamic Caching, das den lokalen GPU-Speicher in Echtzeit zuweist. Wir haben keine Messdaten zu dessen Auswirkungen auf LLMs und machen dazu auch keine Versprechungen.
#Lokale KI oder Apple Intelligence: zwei verschiedene Dinge
Lokale KI auf Ihrem Mac voll ausschöpfen: Unified Memory, MLX vs. GGUF, das passende Modell für Ihren Chip und auf Apple Silicon abgestimmte Einstellungen für Ollama und LM Studio.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
Viele Suchanfragen zum MacBook Air M3 beziehen sich auf „KI“ im weiteren Sinne. Apple Intelligence ist die in macOS integrierte Sammlung von Funktionen (Zusammenfassungen, Schreiben, Siri); laut Apple funktioniert sie auf Macs mit einem M1-Chip oder neuer, also auch auf dem MacBook Air M3. Sie ermöglicht Ihnen weder, das Modell auszuwählen, noch eine API bereitzustellen oder mit einem offenen Modell Ihre eigenen Dokumente zu bearbeiten.
Lokale KI, um die es in diesem Leitfaden geht, bedeutet, ein offenes Modell (Qwen, Gemma, Granite, Mistral) herunterzuladen und mit Ollama, LM Studio oder MLX auszuführen. Sie entscheiden über das Modell, die Kontextgröße und darüber, was auf dem Rechner bleibt. Beides kann nebeneinander bestehen; der Arbeitsspeicher wird jedoch gemeinsam genutzt, und ein geladenes Modell mit 9 Milliarden Parametern reduziert den Speicher, der für macOS und die Anwendungen übrig bleibt.
#Wie viel Speicher: 8, 16 oder 24 GB
Der Speicher ist das wichtigste Kriterium, denn ein Modell, das die verfügbare Speicherkapazität überschreitet, wird nicht langsamer: Es wird unbrauchbar. Auf Apple Silicon kann die GPU nicht den gesamten vereinheitlichten Speicher nutzen; laut den Diskussionen im llama.cpp-Repository stellt Metal ihr standardmäßig zwischen zwei Dritteln und drei Vierteln davon zur Verfügung. Rechnen Sie bei einem Gerät mit 16 GB mit etwa 10 bis 12 GB für das Modell und seinen Kontext.
| Speicher | Für das Modell nutzbar (Schätzung) | Was mit ausreichend Spielraum hineinpasst | Was gerade noch in den Speicher passt |
|---|---|---|---|
| 8 GB | 5 bis 6 GB | Qwen 3.5 4B (2,3 GB), Gemma 4 2B (1,2 GB) | Granite 4.2 8B (4,6 GB), kurzer Kontext |
| 16 GB | 10 bis 12 GB | Qwen 3.5 9B (6 GB), Granite 4.2 8B, Gemma 4 12B (7 GB) | Modelle ab 14 GB: nein |
| 24 GB | 16 bis 18 GB | Qwen 3.5 9B in Q8, Gemma 4 12B, Modelle mit 14 bis 16 GB | Mistral Small 3.2 24B (14 GB) oder Qwen 3.5 27B (16 GB): lassen sich laden, laufen aber langsam |
Die Spalte „nutzbar“ ist eine Schätzung anhand der Zwei-Drittel- bis Drei-Viertel-Regel, keine Angabe von Apple. Die 8-GB-Variante ist nur sinnvoll, wenn Sie wissen, dass Sie bei kleinen Modellen bleiben werden; da sich der Arbeitsspeicher später nicht erweitern lässt, ist die 16-GB-Variante die vernünftige Wahl für lokale KI. Um zu prüfen, ob ein Modell samt Kontext in den Speicher passt, liefert der Speicherrechner dieser Website den Gesamtbedarf.
#Welches Modell wählen und welche Geschwindigkeit erwarten?
Der Generierungsdurchsatz wird durch die Bandbreite geteilt durch die Größe der bei jedem Token gelesenen Gewichte begrenzt. Bei 100 GB/s liegt die Obergrenze für ein 4,6-GB-Modell bei etwa 21 Tokens pro Sekunde, für ein 6-GB-Modell bei etwa 16 und für ein 14-GB-Modell bei etwa 7. In den veröffentlichten Messungen für ein Llama 7B erreicht der M3 in Q4_0 21,34 Tokens pro Sekunde, also etwa 80 % der Obergrenze. Es handelt sich um theoretische Obergrenzen, nicht um Garantien.
| Modell (Q4) | Modellgröße | Obergrenze (100 ÷ Größe der Gewichte) | Zusammenfassung |
|---|---|---|---|
| Qwen 3.5 4B | 2,3 GB | etwa 43 t/s | Sehr flüssig, kurze und schnelle Antworten |
| Granite 4.2 8B | 4,6 GB | etwa 21 t/s | Guter Kompromiss für Chat und Zusammenfassungen |
| Qwen 3.5 9B | 6 GB | ca. 16 t/s | Die Wahl für Qualität bei 16 GB |
| Gemma 4 12B | 7 GB | etwa 14 t/s | Läuft ordentlich mit 16 GB und moderatem Kontext |
| Mistral Small 3.2 24B | 14 GB | ca. 7 t/s | Lesbar, aber kein interaktiver Einsatz mehr |
| Qwen 3.5 27B | 16 GB | etwa 6 t/s | Nur für lange Aufgaben auf einem Rechner mit 24 GB verwenden |
Wenn das Ergebnis zu langsam ist, liegt der Hebel nicht bei einer Einstellung, sondern bei der Modellgröße: Ein Wechsel von 9B auf 4B verdoppelt ungefähr den Durchsatz. Für Code ist ein spezialisiertes Modell mit 7 bis 9B nützlicher als ein 24B-Modell, das für den Einsatz in Echtzeit zu langsam ist. Die Geschwindigkeitstabelle auf der Website (/benchmarks) enthält die je nach Hardware veröffentlichten Messwerte.
#Ohne Lüfter: Die Hitze begrenzt lange Generierungen
Das MacBook Air hat keinen Lüfter. Bei einer kurzen Frage werden Sie das nicht bemerken. Beim Zusammenfassen mehrerer Dutzend Seiten oder bei einer mehrminütigen Generierung erwärmt sich der Chip und senkt schließlich seine Taktfrequenz und damit seinen Durchsatz. Das Phänomen hängt vom Raum, der Last und der Umgebung ab; wir haben keine Messung, die wir dazu anführen können, und Sie sollten es auf Ihrem Rechner mit einer längeren Generierung überprüfen.
- Den Rechner auf eine Unterlage stellen, die eine gute Belüftung ermöglicht
- Ein Aluminiumständer oder eine harte Oberfläche hilft dem Gehäuse, Wärme abzuführen; ein Sofa oder ein Bett verhindert dies.
- Pausen planen
- Teilen Sie bei langen Aufgaben die Arbeit in mehrere Teilaufgaben auf, statt alles in einem einzigen, mehrere Minuten dauernden Generierungslauf zu erledigen.
- Ein kleineres Modell verwenden
- Ein 4B- oder 8B-Modell erzeugt deutlich weniger Wärme als ein Modell, das die Bandbreite ständig vollständig auslastet.
- An den Netzstrom anschließen
- Im Akkubetrieb kann macOS die Leistung begrenzen, um Energie zu sparen.
#Ollama installieren und erstes Modell starten
Ollama erfordert macOS Sonoma (14) oder neuer. Am einfachsten ist es, die Anwendung von der offiziellen Website herunterzuladen; die Installationsanleitung beschreibt die Homebrew-Variante im Detail. Nach dem Start lauscht die Anwendung auf Port 11434 des Rechners, und die Modelle lassen sich mit einem einzigen Befehl herunterladen.
- 01Ollama installierenLaden Sie die Anwendung herunter oder folgen Sie der Installationsanleitung für macOS, dann starten Sie sie erstmals.
- 02Ein Modell nach der Speichergröße auswählen8 GB: ein Modell mit 3 bis 4 Milliarden Parametern. 16 GB: ein 8B (5,2 GB in der Bibliothek Ollama). 24 GB: ein 14B (9,3 GB) oder größer.
- 03Generierung startenFühren Sie ollama run gefolgt vom Modellnamen aus: Der Download erfolgt beim ersten Aufruf.
- 04Die Speicherbelegung während der Nutzung überprüfenÖffnen Sie die Aktivitätsanzeige und wechseln Sie zum Tab „Speicher“: Die Speicherdruckanzeige muss grün bleiben. Wenn sie gelb oder rot wird, ist das Modell zu groß oder der Kontext zu lang.
Die Ollama-Bibliothek gibt 5,2 GB für qwen3:8b und 9,3 GB für qwen3:14b an. Das zweite Modell eignet sich für ein MacBook Air mit 24 GB, nicht für eines mit 16 GB, auf dem es zu wenig Speicherreserven lässt. Wenn Sie MLX statt Ollama testen möchten, erklärt der entsprechende Leitfaden den Unterschied und die Grenzen der beiden Tools.
#Zwei Ollama-Einstellungen, die bei 16 GB wichtig sind
Der erste Faktor ist die Kontextgröße. Die offizielle FAQ von Ollama nennt ein standardmäßiges Kontextfenster von 4.096 Tokens, das sich ändern lässt; eine Vergrößerung benötigt Speicher für den Cache. Bei langen Dokumenten sollten Sie es schrittweise vergrößern, statt einen Maximalwert festzulegen. Der zweite Faktor ist die Quantisierung des KV-Caches: Laut derselben FAQ unterstützt Ollama die Variable OLLAMA_KV_CACHE_TYPE mit dem Wert q8_0. Dieses Format benötigt etwa halb so viel Speicher wie das standardmäßige f16-Format, sofern Flash Attention aktiviert ist.
Auf dem Mac erläutert die FAQ, dass die Variablen mit launchctl gesetzt werden, wenn Ollama als App läuft, und die App anschließend neu gestartet werden muss. Der Optimierungsleitfaden für Macs mit Apple Silicon ergänzt diese Einstellungen auf macOS-Ebene.
#MLX oder Ollama auf MacBook Air M3
MLX ist Apples Machine-Learning-Framework für seine Chips. Es eignet sich für Entwickler, die das Modell von Python aus steuern oder lokal ein LoRA-Fine-Tuning durchführen möchten. Ollama hingegen übernimmt das Herunterladen, das Laden und die API; es ist der einfachste Einstieg. Die Geschwindigkeitsunterschiede zwischen den beiden hängen vom Modell und der Version ab: Statt einen Prozentsatz zu versprechen, verweisen wir auf den ausführlichen Vergleich auf dieser Website.
#Sollten Sie auf ein MacBook Air M4 oder neuer umsteigen?
Laut der Tabelle von llama.cpp erhöht der M4 die Bandbreite auf 120 GB/s, also um 20 % gegenüber dem M3: In dieser Tabelle steigt die Geschwindigkeit eines Llama 7B in Q4_0 von 21,34 auf 24,11 Tokens pro Sekunde. Bei Modellen ab 8B ist das spürbar, aber kein grundlegender Unterschied. Die eigentliche Grenze des M3 bleibt die Speicherkapazität, nicht die Geschwindigkeit.
| Ihre Situation | Empfehlung |
|---|---|
| Air M3 mit 16 GB, Chat und Zusammenfassungen mit 8B- bis 9B-Modellen | Behalten Sie ihn: Ein M4 bietet etwa 20 % mehr Durchsatz. |
| Air M3 8 GB, Interesse an Modellen ab 8B | Wechseln Sie zu einem Modell mit mindestens 16 GB: Der Speicher ist der begrenzende Faktor |
| Bedarf, ein Modell mit 24 bis 32 Milliarden Parametern komfortabel zu betreiben | Ein Mac mit höherer Bandbreite und mehr Speicher (MacBook Pro, Mac mini M4 Pro) |
| Lange Generierungen ohne Unterbrechung | Ein Mac mit Lüfter, um eine Absenkung der Taktfrequenz zu vermeiden |
- MacBook Air M4: der Nachfolger
- MacBook Air M2: die vorherige Generation
- MacBook Pro M2: mit Lüfter
- macOS-Einstellungen für Apple Silicon
- Quelle: technische Spezifikation des MacBook Air M3 (Apple)
- Quelle: llama.cpp-Messungen auf Apple-Chips
- Quelle: Offizielle Ollama-FAQ
#Häufig gestellte Fragen
Kann das MacBook Air M3 ein LLM mit 70 Milliarden Parametern ausführen?+
Welche Geschwindigkeit kann man auf einem MacBook Air M3 erwarten?+
MacBook Air M3 8 GB oder MacBook Air M2 16 GB für lokale KI?+
Kann man die Neural Engine für die Ausführung von LLMs verwenden?+
Wird das MacBook Air M3 bei lokaler KI zu heiß?+
Welches Modell zum Programmieren auf einem MacBook Air M3 mit 16 GB?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.