🇺🇸 Gemma 4 E4B
4 Milliarden effektive Parameter, multimodal (Text+Bild+Audio). 140 Sprachen. Für Laptops und Edge-Geräte.
ollama run gemma4:e4b
Ranking aktualisiert am 22.09.2026
Das MacBook Air M3 (8 / 16 / 24 GB, 100 GB/s) bleibt ein hervorragender Laptop für lokale KI. Da es keinen Lüfter hat, bevorzugen wir Modelle mit 3–9 Milliarden Parametern in Q4_K_M und MoE-Modelle mit wenigen aktiven Parametern.
MacBook Air M3 : Kaufalternative für lokale KI verfügbar — MacBook Pro M5 Pro — 24 GB / 1 TB :
Welchen PC sollten Sie je nach Budget wählen? Unsere Auswahl von 800 bis 3 500 € →
Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass Ihnen Mehrkosten entstehen. Dies beeinflusst die unabhängig erstellte Rangliste nicht. Als Amazon-Partner verdient QuelLLM an qualifizierten Käufen.
4 Milliarden effektive Parameter, multimodal (Text+Bild+Audio). 140 Sprachen. Für Laptops und Edge-Geräte.
ollama run gemma4:e4b
Dense 8B Apache 2.0, 12 Sprachen inkl. FR, 131k ctx, GQA 32Q/8KV. MMLU 73.84, HumanEval 85.37. Veröffentlichung 29. April 2026.
# HuggingFace : ibm-granite/granite-4.1-8b
Granite 4.2 8B (IBM): Dichtes Modell unter Apache 2.0, 128k Kontext, ~4,6 GB VRAM bei Q4. Chat, Code und Reasoning in mehreren Sprachen für Unternehmen.
ollama pull granite4.2
SFT-„thinking“-Variante von OLMo 3 7B: schrittweises Schlussfolgern, 16k Kontext, ca. 4,2 GB VRAM bei Q4. Zu 100 % offen, Apache-2.0-Lizenz.
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
GLM 5.3 (Zhipu): Dichtes 7B-Modell, spezialisiert auf Code und Reasoning, 128k Kontext, ~4,1 GB VRAM bei Q4. Leicht, läuft auf GPUs mit 6-8 GB, MIT-Lizenz.
ollama pull glm-5.3
Dichtes Modell mit 7B Parametern, zu 100 % offen (Gewichte + Daten + Code). Volle Transparenz für die Forschung.
ollama run olmo-3:7b
Hybrider Thinking/Fast-Modus. 119 Sprachen, 32k nativ (131k via YaRN).
ollama run qwen3:8b
| Rang | Modell | Params | VRAM Q4 | Kontext | Lizenz | Auf Apple M2 (16 GB) |
|---|---|---|---|---|---|---|
| #1 | Gemma 4 E4B | 4B | 10 GB | 128 000 | Apache 2.0 | 14 tok/s · Q4_K_M |
| #2 | Granite 4.1 8B Instruct | 8B | 5 GB | 131 072 | Apache 2.0 | 12 Tok/s · Q8 |
| #3 | Granite 4.2 8B | 8B | 4,6 GB | 128 000 | Apache 2.0 | 32 Tok/s · Q8 |
| #4 | OLMo 3 7B Think (SFT) | 7B | 4,2 GB | 16 000 | Apache 2.0 | 32 Tok/s · Q8 |
| #5 | GLM 5.3 7B | 7B | 4.1 GB | 128 000 | MIT | 32 Tok/s · Q8 |
| #6 | OLMo 3 7B | 7B | 5 GB | 8 192 | Apache 2.0 | 12 Tok/s · Q8 |
| #7 | Qwen 3 8B | 8B | 5 GB | 131 072 | Apache 2.0 | 12 Tok/s · Q8 |
Lokale KI auf Ihrem Mac voll ausschöpfen: Unified Memory, MLX vs. GGUF, das passende Modell für Ihren Chip und auf Apple Silicon abgestimmte Einstellungen für Ollama und LM Studio.
Kostenloses Memo
Memo erhalten VRAM → bestes Code-Modell → Ollama-Befehl (alles auf einem Bildschirm, zum Kopieren und Einfügen). Und wechseln Sie zum Kit Copilote Local, um daraus ein wirklich funktionierendes Setup zu machen.
Das Kit „Copilote Local“ — die Ollama- + Cline- + Aider-Configs zum direkten Einfügen, angepasste Modelfiles, Hilfe bei Problemen, lebenslanger Zugang zum Onlinebereich →Kein Spam. Abmeldung mit 1 Klick. Ihre Daten bleiben bei uns (werden nie weiterverkauft).
Ihre Karte → das beste Code-Modell für die lokale Ausführung und der exakte Ollama-Befehl:
| Ihr VRAM | Typische GPUs / Macs | Empfohlenes Code-Modell | Ollama-Befehl |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) oder Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — Code-Agent-Spezialist | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — „nahe an Copilot“ | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — schnelles MoE | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — das ist in diesem speziellen Fall immer noch der Referenzstandard. ⚠️ Qwen 3.8: sein Reasoning ist standardmäßig sehr hoch eingestellt, und es „denkt“ bei einfachen Anfragen zu viel nach — stellen Sie es auf low (oder schalten Sie es ab) beim ersten Start. ⚠️ Lizenzfalle: Codestral 22B = Mistral Non-Production License → zum Programmieren bei der Arbeit verboten. Qwen 3.5/3.8, Gemma 4 und Devstral sind unter Apache 2.0 lizenziert. 💡 Abstürze wegen Speicherproblemen? Halten Sie ca. 1,5 GB VRAM für den Kontext frei oder gehen Sie eine Quantisierungsstufe herunter.🔌 Zum Einbinden in VS Code: Cline (Agent für mehrere Dateien), Aider (CLI) oder Tabby/Twinny (FIM-Autovervollständigung) — alle verbinden sich lokal mit Ollama. Das Kit Lokaler Copilot — Configs zum Einfügen + getestetes Setup — ist verfügbar: /copilote-local.
Filter: Modelle mit 1–13 Milliarden Parametern, die in Q4_K_M weniger als 12 GB benötigen. Bonus für 3–8 Milliarden Parameter (Peak auf dem Air M3) und MoE-Modelle mit wenigen aktiven Parametern. Bonus für freie Lizenzen für MLX (einfachere Konvertierung).
Berücksichtigte Kriterien:
Die Bewertung ist vollständig transparent: konsultieren Sie unsere Methodik für Details zur Berechnung des VRAM-Bedarfs und der Tokens pro Sekunde.
MacBook Air M3 mit 8 GB: Ist das machbar?
Gerade so: Llama 3.2 3B Q4 (~2 GB) oder Phi-4 Mini 3,8B Q4 (~2,3 GB) – 30–40 Tokens/s. macOS belegt bereits 4 GB: Für den Kontext bleibt wenig Spielraum. Wirklich minimalistisch; bevorzugen Sie 16 GB.
MacBook Air M3 16 GB: welche Modelle?
Mistral 7B Q4 (~4,5 GB), Qwen 3 8B Q4 (~5 GB), Gemma 4 9B Q4 (~5,5 GB) — 20–28 Tokens/sec. Ideal für Chats, leichte Codegenerierung, persönliche RAG-Anwendungen. Weitere Informationen finden Sie im Leitfaden für MacBook Air M3.
Air M3 vs. Air M4: Was ist der Unterschied bei LLMs?
M4 ist bei gleicher Speicherbandbreite etwa 15–20 % schneller (leistungsfähigere Neural Engine). Für LLMs bleibt der Unterschied gering: Mistral 7B Q4 = 25 Tokens/s auf M3 gegenüber 30 Tokens/s auf M4. Ein Upgrade ist nicht notwendig.
Welches französischsprachige Modell für das MacBook Air M3?
Mistral 7B Instruct oder Mistral Nemo 12B Q4 (mit 24 GB) sind für Französisch am besten. Lucie 7B (CNRS) ist die zu 100 % souveräne Option, hat aber nur einen Kontext von 4k. Siehe Rangliste für Französisch.