Welcher LLM für MacBook Air M2 (8 / 16 / 24 GB) ?
Das MacBook Air M2 kann mit 8 GB Modelle mit 3 bis 4 Milliarden Parametern betreiben, mit 16 GB Modelle mit 8 bis 9 Milliarden und mit 24 GB bis zu ein 24B-Modell in Q4. Seine Bandbreite von 100 GB/s, laut Apple 50 % mehr als beim M1, begrenzt ein 8B-Modell in Q4 auf etwa 20 Tokens pro Sekunde; der Arbeitsspeicher entscheidet darüber, was geladen werden kann.
Der M2 ist der erste Chip im MacBook Air, der 24 GB und 100 GB/s bietet. Diese Seite erklärt, welche Modellklasse Sie bei 8, 16 oder 24 GB wählen sollten, berechnet die physikalisch maximal mögliche Geschwindigkeit und zeigt, wann ein Wechsel zum M4 sinnvoll ist.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: MacBook Pro M5 Pro — 24 GB / 1 TB.
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#MacBook Air M2: Bandbreite von 100 GB/s und bis zu 24 GB
Das MacBook Air M2 bringt gegenüber dem M1 zwei Änderungen mit, die für ein LLM wichtig sind: Die Bandbreite steigt auf 100 GB/s, und die Speicherkapazität kann bis zu 24 GB betragen. Apple gibt für den M2 100 GB/s an, also 50 % mehr als beim M1; das ist die offizielle Zahl und kein Zuwachs von 47 %, wie gelegentlich zu lesen ist. Die maximale Generierungsgeschwindigkeit steigt dadurch je nach Modell um etwa ein Drittel bis zur Hälfte, und die nutzbare Modellklasse rückt eine Stufe nach oben.
- Chip
- Apple M2: CPU mit 8 Kernen (4 Performance-Kerne, 4 Effizienzkerne), GPU mit 8 Kernen oder 10 Kernen in der höher ausgestatteten Konfiguration, Neural Engine mit 16 Kernen, laut Apples technischen Daten.
- Speicher
- Laut Apples technischen Daten gibt es das MacBook Air M2 mit 8 GB (konfigurierbar mit 16 oder 24 GB) und mit 16 GB (konfigurierbar mit 24 GB). Der Arbeitsspeicher ist verlötet: Die Entscheidung fällt beim Kauf.
- Bandbreite
- 100 GB/s laut Apple, also 50 % mehr als beim M1.
- Kühlung
- Kein Lüfter: Apple beschreibt das MacBook Air M2 als leise und lüfterlos. Bei anhaltender Last hat diese Ruhe ihren Preis; siehe den Abschnitt zum thermischen Verhalten.
- Akku
- 52,6 Wh; Apple gibt bis zu 15 Stunden drahtloses Surfen im Web an. Ein LLM, das die GPU beansprucht, verbraucht deutlich mehr Strom als eine Webseite.
#8, 16 oder 24 GB: Was jede Speicherstufe ermöglicht
Auf einem MacBook Air M2 zählt jedes Gigabyte. Das Mac-Kit hilft Ihnen, ein Modell auszuwählen, das tatsächlich in den verfügbaren Speicher passt (Kap. 4), Ihr Speicherbudget zu berechnen (Kap. 5) und die Auswirkungen auf Wärmeentwicklung und Akku zu messen (Kap. 6).
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Ein Modell kann nicht den gesamten Speicher belegen: macOS, der Browser und Ihre Anwendungen beanspruchen einen Teil davon. Rechnen Sie bei 8 GB mit etwa 4 bis 5 GB verfügbarem Spielraum für das Modell und seinen Kontext, bei 16 GB mit 10 bis 11 GB und bei 24 GB mit 16 bis 18 GB. Das sind vorsichtige Schätzungen, die Sie mit dem Speicherdruck in der Aktivitätsanzeige abgleichen sollten. Der Speicherbedarf eines Modells folgt den Richtwerten der Website: 3B etwa 2 GB, 7–8B etwa 5 GB, 14B etwa 9 GB und 32B etwa 19 bis 20 GB in Q4.
| Speicher | Speicherspielraum für Modell und Kontext | Modellklasse mit ausreichend Spielraum | An der Grenze |
|---|---|---|---|
| 8 GB | ≈ 4 bis 5 GB | 3-4B | 8B mit sehr kurzem Kontext |
| 16 GB | ≈ 10 bis 11 GB | 8-9B, mittlerer Kontext | 12B mit kurzen Kontexten |
| 24 GB | ≈ 16 bis 18 GB | 12–14B-Modelle problemlos, 8–9B-Modelle in Q8 oder mit langem Kontext | 24B-Modell in Q4 (≈ 14 GB) mit reduziertem Kontext |
Die Ausstattung mit 24 GB verändert die Möglichkeiten des Geräts grundlegend: Sie ermöglicht Modelle mit 24 Milliarden Parametern in Q4 (etwa 14 GB für die Modellgewichte), was mit keinem Air M1 möglich ist. Diese Ausstattung ist allerdings selten: Da der Arbeitsspeicher nicht erweiterbar ist, haben die meisten im Umlauf befindlichen Air M2 8 oder 16 GB. Prüfen Sie im Apple-Menü unter „Über diesen Mac“, wie viel Arbeitsspeicher das Gerät tatsächlich hat, bevor Sie ein Modell auswählen.
#Die maximale Geschwindigkeit, die der M2 erreichen kann
Bei der Generierung werden die aktiven Modellgewichte für jedes Token gelesen: Die maximale Geschwindigkeit entspricht der Bandbreite geteilt durch die Größe dieser Gewichte in Gigabyte. Die folgende Tabelle wendet die Formel auf den M2 (100 GB/s) und den M1 (etwa 68 GB/s) an. Das sind berechnete Obergrenzen, niemals Messwerte: Die tatsächliche Geschwindigkeit ist niedriger und hängt von der Inferenz-Engine, der Quantisierung und der Kontextlänge ab. Mit diesen Obergrenzen lässt sich prüfen, ob eine andernorts angegebene Zahl physikalisch möglich ist.
| Modell | Modellgröße | Air M1 (≈ 68 GB/s) | Air M2 (100 GB/s) |
|---|---|---|---|
| 3B | ≈ 2 GB | ≈ 34 tok/s | ≈ 50 tok/s |
| 4B | ≈ 2,5 bis 3 GB | ≈ 23 bis 27 Tok/s | ≈ 33 bis 40 Tok/s |
| 8B | ≈ 5 GB | ≈ 13 tok/s | ≈ 20 Tok/s |
| 12B | ≈ 7,5 GB | ≈ 9 Tok/s | ≈ 13 tok/s |
| 24B | ≈ 14 GB | nicht anwendbar (Speicher) | ≈ 7 Tok/s |
Daraus ergeben sich zwei Schlussfolgerungen. Erstens liegt ein 8B-Modell in Q4 auf einem M2 theoretisch unter 20 Tokens pro Sekunde: Ein angezeigter Durchsatz von 25 oder 28 Tokens pro Sekunde für dieses Modell auf diesem Chip kann nicht aus der klassischen Generierung stammen. Zweitens liegt die Obergrenze eines 24B-Modells bei etwa 7 Tokens pro Sekunde: Es ist für eine Antwort ohne Zeitdruck nutzbar, nicht für einen schnellen Austausch. Für tatsächliche Messwerte sehen Sie sich /benchmarks und Benchmarks von Drittanbietern an und prüfen Sie dabei Chip, Quantisierung und Engine.
#Ein Modell installieren und die GPU überprüfen
- 01Ollama installierenLaden Sie es von ollama.com oder über Homebrew herunter. Die macOS-Installationsanleitung auf dieser Website erläutert die Startoptionen.
- 02Das Modell entsprechend der Speicherkapazität wählen4B auf 8 GB, 8–9B auf 16 GB, 12–14B oder ein 24B in Q4 auf 24 GB. Starten Sie mit ollama run und dem Modellnamen.
- 03GPU überprüfenIn einem anderen Terminal zeigt ollama ps die CPU/GPU-Verteilung in der Spalte PROCESSOR an. Erwartet wird, dass alles auf der GPU läuft.
- 04Kontext anpassenBei weniger als 24 GiB Speicher legt Ollama den Standardkontext auf 4.000 Tokens fest. Erhöhen Sie ihn schrittweise statt auf einmal: Der KV-Cache belegt mit jedem Token Speicher.
Die Modelle werden in ~/.ollama/models installiert. Auf einem Air M2 mit einer 256-GB-SSD reichen einige Modelle mit jeweils 5 bis 15 GB aus, um den freien Speicherplatz zu füllen: Löschen Sie Modelle, die Sie nicht mehr verwenden, mit ollama rm.
Eine nützliche Orientierung für die Auswahl: Beginnen Sie mit dem kleinsten Modell, das Ihre Aufgabe korrekt löst, und wechseln Sie nur dann zur nächstgrößeren Variante, wenn die Antworten weiterhin unzureichend sind. Auf einem Rechner mit begrenzter Bandbreite kostet jede zusätzliche Milliarde Parameter Geschwindigkeit. Testen Sie vor Ihrer Entscheidung zwei Kandidaten mit fünf Ihrer eigenen tatsächlichen Anfragen: Das dauert zehn Minuten und erspart Ihnen den Download eines zu großen Modells.
#Die 24-GB-Variante und RAG: Was diese Speicherstufe wirklich ermöglicht
Ein Assistent für Ihre Dokumente benötigt drei Bausteine: ein Embedding-Modell, das indexiert, ein Generierungsmodell, das antwortet, und gegebenenfalls einen Reranker, der die Textpassagen sortiert. Mit 8 GB wird es für das gesamte Setup knapp. Mit 16 GB können ein leichtes Embedding-Modell und ein 8–9B-Modell bei kurzem Kontext gleichzeitig im Speicher liegen. Mit 24 GB können Sie einen Reranker hinzufügen und einen Kontext von mehreren Tausend Tokens nutzen, ohne auf die SSD zu schreiben. Bei diesem Einsatz lohnt sich die nächsthöhere Speicherausstattung besonders.
- Vor der Indexierung
- Prüfen Sie, ob das Embedding-Modell zusammen mit dem Generierungsmodell in den Speicher passt: Beide bleiben während der Anfrage geladen.
- Während der Anfrage
- Fügen Sie einige gut ausgewählte Passagen ein statt eines ganzen Dokuments: Der Kontext beansprucht Speicher und Rechenzeit.
- Danach
- Wenn der Speicherdruck auf Gelb geht, verringern Sie die Anzahl der Durchläufe oder wechseln zu einem kleineren Modell.
#Quantisierung und KV-Cache auf M2
Auf einer Maschine, deren Leistung durch die Speicherbandbreite begrenzt ist, bleibt Q4_K_M die Standardeinstellung: Das Modell ist kleiner und lässt sich daher schneller auslesen. Q5_K_M ist sinnvoll, wenn der Speicher ausreicht und die Qualität Vorrang hat. Q8_0 verdoppelt nahezu die Modellgröße und halbiert ungefähr die maximal erreichbare Geschwindigkeit. Für den KV-Cache verwendet Ollama automatisch Flash Attention, wenn Engine und Hardware dies unterstützen; die Variable OLLAMA_KV_CACHE_TYPE legt die Quantisierung des Caches fest, wobei f16 der Standardwert ist. Die Cache-Quantisierung macht lange Kontexte mit 16 GB Speicher leichter nutzbar, allerdings auf Kosten eines leichten Genauigkeitsverlusts.
#Akkulaufzeit, geräuschloser Betrieb und Wärmeentwicklung
Das Air M2 hat keinen Lüfter: Es bleibt lautlos, was sich für ein ruhiges Büro oder einen über Nacht laufenden Assistenten eignet. Das Gehäuse führt die Wärme passiv ab, sodass eine Belastung über mehrere zehn Minuten die Taktfrequenz des Chips senkt. Diese Seite nennt weder eine Zeit- noch eine Temperaturschwelle: Keine Primärquelle legt diese fest, und sie variieren je nach Raum. Im Akkubetrieb nimmt die Akkulaufzeit deutlich schneller ab als beim Surfen, weil die GPU kontinuierlich arbeitet; schließen Sie das Gerät für eine lange Sitzung ans Stromnetz an.
- Lange Prozesse
- Schließen Sie das Gerät ans Stromnetz an, stellen Sie es etwas erhöht auf und vermeiden Sie Anwendungen, die den Prozessor gleichzeitig belasten.
- Energieeinsparmodus
- macOS bietet diesen Modus in den Batterieeinstellungen an. Er drosselt die Leistung: Verwenden Sie ihn unterwegs, wenn die Akkulaufzeit wichtiger ist als die Geschwindigkeit.
- Stetige Belastung
- Für einen lokalen Server, der den ganzen Tag antwortet, ist ein Mac mini mit Lüfter geeigneter als ein Air.
#Beim M2 bleiben oder auf einen M3 oder M4 umsteigen?
Laut Apples technischen Daten behält der M3 im Air dieselbe Bandbreite von 100 GB/s und dieselbe Speicherobergrenze von 24 GB bei: Bei einem LLM bringt der Wechsel von M2 zu M3 bei der Generierung fast keinen messbaren Vorteil. Der M4 erhöht die Bandbreite auf 120 GB/s und den Speicher auf 32 GB, was sowohl die maximale Geschwindigkeit als auch die Modellklasse verändert.
| Kriterium | Air M2 | Air M3 | Air M4 |
|---|---|---|---|
| Bandbreite | 100 GB/s | 100 GB/s | 120 GB/s |
| Maximaler Speicher | 24 GB | 24 GB | 32 GB |
| Entscheidung | Bei 16 GB oder 24 GB beibehalten | Wenig Gründe für einen Wechsel vom M2 | Wechseln, wenn Sie mehr als 24 GB möchten |
- Behalten Sie Ihren M2 mit 16 oder 24 GB
- Er deckt 8-9B und 12-14B problemlos ab; der M4 verbessert die maximale Geschwindigkeit nur um etwa 20 %.
- Wechseln Sie das Gerät, wenn Sie 8 GB haben
- Der Vorteil betrifft die Modellklasse, nicht die Geschwindigkeit: Ein Air mit mindestens 16 GB RAM ermöglicht den Wechsel von 4B zu 8-9B-Modellen.
- Wechseln Sie das Gerät, wenn Sie mehr als 24 GB möchten
- Nur der M4 bietet auf dem Air 32 GB; darüber hinaus sollten Sie den MacBook Pro M4 Pro oder Max betrachten.
- MacBook Air M1: die Grenzen bei 8 und 16 GB
- MacBook Air M3: ebenso 100 GB/s
- MacBook Air M4: 32 GB und 120 GB/s
- Ollama auf macOS installieren
- MacBook Pro M4 Pro und Max, bis zu 128 GB
- VRAM-Rechner der Website
- Quelle: Apples technische Daten zum MacBook Air M2
- Quelle: Apple, Ankündigung des M2-Chips
- Quelle: technische Spezifikationen von Apple für das MacBook Air M4
- Quelle: Ollama-Dokumentation, Kontext
#Häufig gestellte Fragen
Kann ein MacBook Air M2 mit 8 GB RAM ein 8B-Modell ausführen?+
Was ist der tatsächliche Unterschied zwischen dem MacBook Air M2 und dem M3 beim Einsatz eines LLM?+
Lohnt sich das MacBook Air M2 mit 24 GB für lokale KI?+
Mit welcher Geschwindigkeit läuft ein 8B-LLM auf dem MacBook Air M2?+
Schaltet sich der Lüfter des Air M2 bei einem großen Modell ein?+
Ollama oder LM Studio auf einem Air M2?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.