Einsteiger 11 Min.MacBook Air

Welcher LLM für MacBook Air M2 (8 / 16 / 24 GB) ?

Direkte Antwort

Das MacBook Air M2 kann mit 8 GB Modelle mit 3 bis 4 Milliarden Parametern betreiben, mit 16 GB Modelle mit 8 bis 9 Milliarden und mit 24 GB bis zu ein 24B-Modell in Q4. Seine Bandbreite von 100 GB/s, laut Apple 50 % mehr als beim M1, begrenzt ein 8B-Modell in Q4 auf etwa 20 Tokens pro Sekunde; der Arbeitsspeicher entscheidet darüber, was geladen werden kann.

Der M2 ist der erste Chip im MacBook Air, der 24 GB und 100 GB/s bietet. Diese Seite erklärt, welche Modellklasse Sie bei 8, 16 oder 24 GB wählen sollten, berechnet die physikalisch maximal mögliche Geschwindigkeit und zeigt, wann ein Wechsel zum M4 sinnvoll ist.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-29·Getestet auf macOS 14+
Empfohlene Hardware

Kaufalternative für diesen Guide: MacBook Pro M5 Pro — 24 GB / 1 TB.

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#MacBook Air M2: Bandbreite von 100 GB/s und bis zu 24 GB

Das MacBook Air M2 bringt gegenüber dem M1 zwei Änderungen mit, die für ein LLM wichtig sind: Die Bandbreite steigt auf 100 GB/s, und die Speicherkapazität kann bis zu 24 GB betragen. Apple gibt für den M2 100 GB/s an, also 50 % mehr als beim M1; das ist die offizielle Zahl und kein Zuwachs von 47 %, wie gelegentlich zu lesen ist. Die maximale Generierungsgeschwindigkeit steigt dadurch je nach Modell um etwa ein Drittel bis zur Hälfte, und die nutzbare Modellklasse rückt eine Stufe nach oben.

Chip
Apple M2: CPU mit 8 Kernen (4 Performance-Kerne, 4 Effizienzkerne), GPU mit 8 Kernen oder 10 Kernen in der höher ausgestatteten Konfiguration, Neural Engine mit 16 Kernen, laut Apples technischen Daten.
Speicher
Laut Apples technischen Daten gibt es das MacBook Air M2 mit 8 GB (konfigurierbar mit 16 oder 24 GB) und mit 16 GB (konfigurierbar mit 24 GB). Der Arbeitsspeicher ist verlötet: Die Entscheidung fällt beim Kauf.
Bandbreite
100 GB/s laut Apple, also 50 % mehr als beim M1.
Kühlung
Kein Lüfter: Apple beschreibt das MacBook Air M2 als leise und lüfterlos. Bei anhaltender Last hat diese Ruhe ihren Preis; siehe den Abschnitt zum thermischen Verhalten.
Akku
52,6 Wh; Apple gibt bis zu 15 Stunden drahtloses Surfen im Web an. Ein LLM, das die GPU beansprucht, verbraucht deutlich mehr Strom als eine Webseite.

#8, 16 oder 24 GB: Was jede Speicherstufe ermöglicht

Das Mac-Kit

Auf einem MacBook Air M2 zählt jedes Gigabyte. Das Mac-Kit hilft Ihnen, ein Modell auszuwählen, das tatsächlich in den verfügbaren Speicher passt (Kap. 4), Ihr Speicherbudget zu berechnen (Kap. 5) und die Auswirkungen auf Wärmeentwicklung und Akku zu messen (Kap. 6).

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Ein Modell kann nicht den gesamten Speicher belegen: macOS, der Browser und Ihre Anwendungen beanspruchen einen Teil davon. Rechnen Sie bei 8 GB mit etwa 4 bis 5 GB verfügbarem Spielraum für das Modell und seinen Kontext, bei 16 GB mit 10 bis 11 GB und bei 24 GB mit 16 bis 18 GB. Das sind vorsichtige Schätzungen, die Sie mit dem Speicherdruck in der Aktivitätsanzeige abgleichen sollten. Der Speicherbedarf eines Modells folgt den Richtwerten der Website: 3B etwa 2 GB, 7–8B etwa 5 GB, 14B etwa 9 GB und 32B etwa 19 bis 20 GB in Q4.

Air M2: realistische Modellklasse je nach Speichergröße (Q4_K_M)
SpeicherSpeicherspielraum für Modell und KontextModellklasse mit ausreichend SpielraumAn der Grenze
8 GB≈ 4 bis 5 GB3-4B8B mit sehr kurzem Kontext
16 GB≈ 10 bis 11 GB8-9B, mittlerer Kontext12B mit kurzen Kontexten
24 GB≈ 16 bis 18 GB12–14B-Modelle problemlos, 8–9B-Modelle in Q8 oder mit langem Kontext24B-Modell in Q4 (≈ 14 GB) mit reduziertem Kontext

Die Ausstattung mit 24 GB verändert die Möglichkeiten des Geräts grundlegend: Sie ermöglicht Modelle mit 24 Milliarden Parametern in Q4 (etwa 14 GB für die Modellgewichte), was mit keinem Air M1 möglich ist. Diese Ausstattung ist allerdings selten: Da der Arbeitsspeicher nicht erweiterbar ist, haben die meisten im Umlauf befindlichen Air M2 8 oder 16 GB. Prüfen Sie im Apple-Menü unter „Über diesen Mac“, wie viel Arbeitsspeicher das Gerät tatsächlich hat, bevor Sie ein Modell auswählen.

→
16 GB: der Schwellenwert, der den wesentlichen Bedarf abdeckt
Für Zusammenfassungen, Texterstellung, Unterstützung beim Programmieren und leichtes RAG reicht ein Modell mit 8 bis 9 Milliarden Parametern in Q4 für die meisten alltäglichen Anwendungen aus. Die Variante mit 24 GB lohnt sich vor allem, wenn Sie ein 24B-Modell, einen sehr langen Kontext oder einen Embedder und einen Reranker parallel zum Generierungsmodell nutzen möchten.

#Die maximale Geschwindigkeit, die der M2 erreichen kann

Bei der Generierung werden die aktiven Modellgewichte für jedes Token gelesen: Die maximale Geschwindigkeit entspricht der Bandbreite geteilt durch die Größe dieser Gewichte in Gigabyte. Die folgende Tabelle wendet die Formel auf den M2 (100 GB/s) und den M1 (etwa 68 GB/s) an. Das sind berechnete Obergrenzen, niemals Messwerte: Die tatsächliche Geschwindigkeit ist niedriger und hängt von der Inferenz-Engine, der Quantisierung und der Kontextlänge ab. Mit diesen Obergrenzen lässt sich prüfen, ob eine andernorts angegebene Zahl physikalisch möglich ist.

Theoretische Obergrenze der Generierungsgeschwindigkeit (nur Modellgewichte in Q4): berechnet, nicht gemessen
ModellModellgrößeAir M1 (≈ 68 GB/s)Air M2 (100 GB/s)
3B≈ 2 GB≈ 34 tok/s≈ 50 tok/s
4B≈ 2,5 bis 3 GB≈ 23 bis 27 Tok/s≈ 33 bis 40 Tok/s
8B≈ 5 GB≈ 13 tok/s≈ 20 Tok/s
12B≈ 7,5 GB≈ 9 Tok/s≈ 13 tok/s
24B≈ 14 GBnicht anwendbar (Speicher)≈ 7 Tok/s

Daraus ergeben sich zwei Schlussfolgerungen. Erstens liegt ein 8B-Modell in Q4 auf einem M2 theoretisch unter 20 Tokens pro Sekunde: Ein angezeigter Durchsatz von 25 oder 28 Tokens pro Sekunde für dieses Modell auf diesem Chip kann nicht aus der klassischen Generierung stammen. Zweitens liegt die Obergrenze eines 24B-Modells bei etwa 7 Tokens pro Sekunde: Es ist für eine Antwort ohne Zeitdruck nutzbar, nicht für einen schnellen Austausch. Für tatsächliche Messwerte sehen Sie sich /benchmarks und Benchmarks von Drittanbietern an und prüfen Sie dabei Chip, Quantisierung und Engine.

#Ein Modell installieren und die GPU überprüfen

  1. 01
    Ollama installieren
    Laden Sie es von ollama.com oder über Homebrew herunter. Die macOS-Installationsanleitung auf dieser Website erläutert die Startoptionen.
  2. 02
    Das Modell entsprechend der Speicherkapazität wählen
    4B auf 8 GB, 8–9B auf 16 GB, 12–14B oder ein 24B in Q4 auf 24 GB. Starten Sie mit ollama run und dem Modellnamen.
  3. 03
    GPU überprüfen
    In einem anderen Terminal zeigt ollama ps die CPU/GPU-Verteilung in der Spalte PROCESSOR an. Erwartet wird, dass alles auf der GPU läuft.
  4. 04
    Kontext anpassen
    Bei weniger als 24 GiB Speicher legt Ollama den Standardkontext auf 4.000 Tokens fest. Erhöhen Sie ihn schrittweise statt auf einmal: Der KV-Cache belegt mit jedem Token Speicher.
Terminal
brew install --cask ollama
ollama run qwen3.5:9b
ollama ps

Die Modelle werden in ~/.ollama/models installiert. Auf einem Air M2 mit einer 256-GB-SSD reichen einige Modelle mit jeweils 5 bis 15 GB aus, um den freien Speicherplatz zu füllen: Löschen Sie Modelle, die Sie nicht mehr verwenden, mit ollama rm.

Eine nützliche Orientierung für die Auswahl: Beginnen Sie mit dem kleinsten Modell, das Ihre Aufgabe korrekt löst, und wechseln Sie nur dann zur nächstgrößeren Variante, wenn die Antworten weiterhin unzureichend sind. Auf einem Rechner mit begrenzter Bandbreite kostet jede zusätzliche Milliarde Parameter Geschwindigkeit. Testen Sie vor Ihrer Entscheidung zwei Kandidaten mit fünf Ihrer eigenen tatsächlichen Anfragen: Das dauert zehn Minuten und erspart Ihnen den Download eines zu großen Modells.

#Die 24-GB-Variante und RAG: Was diese Speicherstufe wirklich ermöglicht

Ein Assistent für Ihre Dokumente benötigt drei Bausteine: ein Embedding-Modell, das indexiert, ein Generierungsmodell, das antwortet, und gegebenenfalls einen Reranker, der die Textpassagen sortiert. Mit 8 GB wird es für das gesamte Setup knapp. Mit 16 GB können ein leichtes Embedding-Modell und ein 8–9B-Modell bei kurzem Kontext gleichzeitig im Speicher liegen. Mit 24 GB können Sie einen Reranker hinzufügen und einen Kontext von mehreren Tausend Tokens nutzen, ohne auf die SSD zu schreiben. Bei diesem Einsatz lohnt sich die nächsthöhere Speicherausstattung besonders.

Vor der Indexierung
Prüfen Sie, ob das Embedding-Modell zusammen mit dem Generierungsmodell in den Speicher passt: Beide bleiben während der Anfrage geladen.
Während der Anfrage
Fügen Sie einige gut ausgewählte Passagen ein statt eines ganzen Dokuments: Der Kontext beansprucht Speicher und Rechenzeit.
Danach
Wenn der Speicherdruck auf Gelb geht, verringern Sie die Anzahl der Durchläufe oder wechseln zu einem kleineren Modell.

#Quantisierung und KV-Cache auf M2

Auf einer Maschine, deren Leistung durch die Speicherbandbreite begrenzt ist, bleibt Q4_K_M die Standardeinstellung: Das Modell ist kleiner und lässt sich daher schneller auslesen. Q5_K_M ist sinnvoll, wenn der Speicher ausreicht und die Qualität Vorrang hat. Q8_0 verdoppelt nahezu die Modellgröße und halbiert ungefähr die maximal erreichbare Geschwindigkeit. Für den KV-Cache verwendet Ollama automatisch Flash Attention, wenn Engine und Hardware dies unterstützen; die Variable OLLAMA_KV_CACHE_TYPE legt die Quantisierung des Caches fest, wobei f16 der Standardwert ist. Die Cache-Quantisierung macht lange Kontexte mit 16 GB Speicher leichter nutzbar, allerdings auf Kosten eines leichten Genauigkeitsverlusts.

#Akkulaufzeit, geräuschloser Betrieb und Wärmeentwicklung

Das Air M2 hat keinen Lüfter: Es bleibt lautlos, was sich für ein ruhiges Büro oder einen über Nacht laufenden Assistenten eignet. Das Gehäuse führt die Wärme passiv ab, sodass eine Belastung über mehrere zehn Minuten die Taktfrequenz des Chips senkt. Diese Seite nennt weder eine Zeit- noch eine Temperaturschwelle: Keine Primärquelle legt diese fest, und sie variieren je nach Raum. Im Akkubetrieb nimmt die Akkulaufzeit deutlich schneller ab als beim Surfen, weil die GPU kontinuierlich arbeitet; schließen Sie das Gerät für eine lange Sitzung ans Stromnetz an.

Lange Prozesse
Schließen Sie das Gerät ans Stromnetz an, stellen Sie es etwas erhöht auf und vermeiden Sie Anwendungen, die den Prozessor gleichzeitig belasten.
Energieeinsparmodus
macOS bietet diesen Modus in den Batterieeinstellungen an. Er drosselt die Leistung: Verwenden Sie ihn unterwegs, wenn die Akkulaufzeit wichtiger ist als die Geschwindigkeit.
Stetige Belastung
Für einen lokalen Server, der den ganzen Tag antwortet, ist ein Mac mini mit Lüfter geeigneter als ein Air.

#Beim M2 bleiben oder auf einen M3 oder M4 umsteigen?

Laut Apples technischen Daten behält der M3 im Air dieselbe Bandbreite von 100 GB/s und dieselbe Speicherobergrenze von 24 GB bei: Bei einem LLM bringt der Wechsel von M2 zu M3 bei der Generierung fast keinen messbaren Vorteil. Der M4 erhöht die Bandbreite auf 120 GB/s und den Speicher auf 32 GB, was sowohl die maximale Geschwindigkeit als auch die Modellklasse verändert.

Air M2, M3 und M4: das Wichtigste für ein lokales LLM laut den technischen Datenblättern von Apple
KriteriumAir M2Air M3Air M4
Bandbreite100 GB/s100 GB/s120 GB/s
Maximaler Speicher24 GB24 GB32 GB
EntscheidungBei 16 GB oder 24 GB beibehaltenWenig Gründe für einen Wechsel vom M2Wechseln, wenn Sie mehr als 24 GB möchten
Behalten Sie Ihren M2 mit 16 oder 24 GB
Er deckt 8-9B und 12-14B problemlos ab; der M4 verbessert die maximale Geschwindigkeit nur um etwa 20 %.
Wechseln Sie das Gerät, wenn Sie 8 GB haben
Der Vorteil betrifft die Modellklasse, nicht die Geschwindigkeit: Ein Air mit mindestens 16 GB RAM ermöglicht den Wechsel von 4B zu 8-9B-Modellen.
Wechseln Sie das Gerät, wenn Sie mehr als 24 GB möchten
Nur der M4 bietet auf dem Air 32 GB; darüber hinaus sollten Sie den MacBook Pro M4 Pro oder Max betrachten.

#Häufig gestellte Fragen

FAQ
Kann ein MacBook Air M2 mit 8 GB RAM ein 8B-Modell ausführen?+
Technisch ja in Q4 (etwa 5 GB Modellgewichte), aber die 4 bis 5 GB Speicher, die macOS übrig lässt, reichen nicht mehr aus, sobald der Kontext größer wird: Das System lagert dann auf die SSD aus und alles wird langsamer. Bleiben Sie bei 8 GB bei einem Modell mit 3 bis 4 Milliarden Parametern und halten Sie den Kontext kurz.
Was ist der tatsächliche Unterschied zwischen dem MacBook Air M2 und dem M3 beim Einsatz eines LLM?+
Sehr gering für die Generierung: Laut Apple-Dokumentation bietet der Air M3 die gleiche Bandbreite von 100 GB/s und den gleichen Maximalwert von 24 GB Speicher. Der M3 bringt vor allem andere Verbesserungen mit sich, ohne direkten Einfluss auf die Lesegeschwindigkeit der Gewichte. Wenn Sie einen M2 haben, warten Sie lieber auf den M4.
Lohnt sich das MacBook Air M2 mit 24 GB für lokale KI?+
Ja, wenn Sie ein Modell mit 24 Milliarden Parametern in Q4 (ca. 14 GB) oder ein RAG mit Embedder und Reranker wünschen: Diese Anwendungen passen nicht in 16 GB. Andernfalls decken 16 GB bereits die Modelle mit 8 bis 9 Milliarden Parametern ab. Prüfen Sie vor dem Kauf die tatsächliche Speicherkapazität des Geräts.
Mit welcher Geschwindigkeit läuft ein 8B-LLM auf dem MacBook Air M2?+
Die theoretische Obergrenze ergibt sich aus der Bandbreite geteilt durch die Modellgröße: 100 GB/s geteilt durch etwa 5 GB ergeben maximal 20 Tokens pro Sekunde für ein 8B-Modell in Q4. Die tatsächliche Geschwindigkeit ist niedriger und hängt von der Inferenz-Engine und dem Kontext ab. Sehen Sie unter /benchmarks oder in Messungen Dritter nach, die den Chip und die Quantisierung angeben.
Schaltet sich der Lüfter des Air M2 bei einem großen Modell ein?+
Nein: Es gibt keinen Lüfter. Apple beschreibt ein lüfterloses, geräuschloses Design. Der Nachteil liegt bei der Wärmeentwicklung: Unter längerer Last reduziert der Chip seine Taktfrequenz, und die Generierung wird langsamer, ohne dass dabei Geräusche entstehen. Für mehrstündige Berechnungen sollten Sie einen Mac mini oder ein MacBook Pro bevorzugen.
Ollama oder LM Studio auf einem Air M2?+
Ollama eignet sich für einen schnellen Einstieg, Skripte und die Integration in andere Tools; LM Studio für eine grafische Oberfläche und das Erkunden von Hugging-Face-Modellen. Beide können nebeneinander bestehen, dürfen aber bei 8 oder 16 GB RAM nicht gleichzeitig zwei Modelle laden: Der Speicher ist der wichtigste begrenzende Faktor.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.