🇺🇸 Gemma 4 26B-A4B MoE
MoE-Variante von Gemma 4. 26B Parameter, davon 4B aktiv. Vollständig multimodal (Text+Bild+Audio).
ollama run gemma4:26b
Ranking aktualisiert am 22.09.2026
Das MacBook Pro M1 Pro / Max (16–64 GB, 200–400 GB/s) ist 4 Jahre alt, bleibt aber nutzbar. Modelle mit 7–32 Milliarden Parametern laufen in Q4 komfortabel, ein 70B-Modell in Q3 ist auf dem Max mit 64 GB machbar.
Vergleichen Sie die Preise für MacBook Pro M5 Pro — 24 GB / 1 TB bei unseren Partnerhändlern (verifizierte Produktseiten):
Welchen PC sollten Sie je nach Budget wählen? Unsere Auswahl von 800 bis 3 500 € →
Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass Ihnen Mehrkosten entstehen. Dies beeinflusst die unabhängig erstellte Rangliste nicht. Als Amazon-Partner verdient QuelLLM an qualifizierten Käufen.
MoE-Variante von Gemma 4. 26B Parameter, davon 4B aktiv. Vollständig multimodal (Text+Bild+Audio).
ollama run gemma4:26b
Erstes offenes dLLM unter Apache 2.0: MoE 16B/1B + Diffusionsdecoder mit 6,2B Parametern. Text und Vision in einem einheitlichen Modell. Veröffentlicht am 22. April 2026.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Dichtes multimodales 27B-Modell, veröffentlicht am 22. April 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Qwen 3.8 27B: dichtes multimodales Modell (Text + Vision), 262k Kontext, ca. 16 GB VRAM bei Q4 (18 GB Ollama-Gewichte). Apache 2.0, agentisches Programmieren und Vision.
ollama run qwen3.8:27b
GLM-4.7-Flash (MoE mit 31B Parametern, davon ~3B aktiv): das beste Verhältnis von Code-Leistung zu VRAM-Bedarf in der 30B-Klasse. MIT, 128k ctx, sehr schnell auf 3090/4090.
ollama run glm-4.7-flash
Dichtes multimodales 31B-Modell (Text+Bild+Audio). 140+ Sprachen, 256k Kontext. Platz 3 in der Chatbot Arena unter den offenen Modellen.
ollama run gemma4:31b
Dichtes 30B-Modell unter Apache 2.0, 12 Sprachen einschließlich Französisch, 131k ctx, GQA 32Q/8KV. OpenAI-kompatibles Tool Calling. Veröffentlicht am 29. April 2026.
ollama run granite4.1:30b
| Rang | Modell | Params | VRAM Q4 | Kontext | Lizenz | Auf Apple M1 (16 GB) |
|---|---|---|---|---|---|---|
| #1 | Gemma 4 26B-A4B MoE | 26B | 16 GB | 128 000 | Apache 2.0 | ✗ |
| #2 | LLaDA 2.0 Uni 16B | 16B | 18 GB | 8 192 | Apache 2.0 | ✗ |
| #3 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 | ✗ |
| #4 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 | ✗ |
| #5 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT | ✗ |
| #6 | Gemma 4 31B | 31B | 18 GB | 256 000 | Apache 2.0 | ✗ |
| #7 | Granite 4.1 30B Instruct | 30B | 17 GB | 131 072 | Apache 2.0 | ✗ |
Lokale KI auf Ihrem Mac voll ausschöpfen: Unified Memory, MLX vs. GGUF, das passende Modell für Ihren Chip und auf Apple Silicon abgestimmte Einstellungen für Ollama und LM Studio.
Kostenloses Memo
Memo erhalten VRAM → bestes Code-Modell → Ollama-Befehl (alles auf einem Bildschirm, zum Kopieren und Einfügen). Und wechseln Sie zum Kit Copilote Local, um daraus ein wirklich funktionierendes Setup zu machen.
Das Kit „Copilote Local“ — die Ollama- + Cline- + Aider-Configs zum direkten Einfügen, angepasste Modelfiles, Hilfe bei Problemen, lebenslanger Zugang zum Onlinebereich →Kein Spam. Abmeldung mit 1 Klick. Ihre Daten bleiben bei uns (werden nie weiterverkauft).
Ihre Karte → das beste Code-Modell für die lokale Ausführung und der exakte Ollama-Befehl:
| Ihr VRAM | Typische GPUs / Macs | Empfohlenes Code-Modell | Ollama-Befehl |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) oder Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — Code-Agent-Spezialist | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — „nahe an Copilot“ | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — schnelles MoE | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — das ist in diesem speziellen Fall immer noch der Referenzstandard. ⚠️ Qwen 3.8: sein Reasoning ist standardmäßig sehr hoch eingestellt, und es „denkt“ bei einfachen Anfragen zu viel nach — stellen Sie es auf low (oder schalten Sie es ab) beim ersten Start. ⚠️ Lizenzfalle: Codestral 22B = Mistral Non-Production License → zum Programmieren bei der Arbeit verboten. Qwen 3.5/3.8, Gemma 4 und Devstral sind unter Apache 2.0 lizenziert. 💡 Abstürze wegen Speicherproblemen? Halten Sie ca. 1,5 GB VRAM für den Kontext frei oder gehen Sie eine Quantisierungsstufe herunter.🔌 Zum Einbinden in VS Code: Cline (Agent für mehrere Dateien), Aider (CLI) oder Tabby/Twinny (FIM-Autovervollständigung) — alle verbinden sich lokal mit Ollama. Das Kit Lokaler Copilot — Configs zum Einfügen + getestetes Setup — ist verfügbar: /copilote-local.
Filter: Modelle mit 3–70B, die in Q4_K_M weniger als 40 GB benötigen. Bonus für 7–32B (Peak M1 Max). Bei 70B bleiben wir vorsichtig (begrenzte Bandbreite gegenüber M3/M4).
Berücksichtigte Kriterien:
Die Bewertung ist vollständig transparent: konsultieren Sie unsere Methodik für Details zur Berechnung des VRAM-Bedarfs und der Tokens pro Sekunde.
MBP M1 Pro mit 16 GB im Jahr 2026: Lohnt sich das?
Ja für 7-8B: Mistral 7B Q4, Qwen 3 8B Q4 mit 22–28 Tok/s. Siehe den Leitfaden zum MBP M1.
Kann ein MBP M1 Max mit 64 GB ein 70B-Modell ausführen?
Ja, in Q3_K_M (~32 GB) mit 6–9 tok/s – für längere Texte nutzbar, für interaktiven Chat langsam. Q4 (~40 GB) passt in den Speicher, ist aber langsamer.
M1 Pro gegen M1 Max bei 32B?
M1 Pro (200 GB/s) ≈ 12 Tok/s mit Mistral Small 24B Q4. M1 Max (400 GB/s) ≈ 22 Tok/s. Der Max verdoppelt die Speicherbandbreite, und das ist spürbar.
Soll man auf M4 upgraden?
Wenn der M1 Max mit 64 GB noch ausreicht, nein. Andernfalls bietet der M4 Pro mit 48 GB eine Bandbreite von 273 GB/s und eine aktuelle Neural Engine — bessere Leistung pro Watt. Siehe MBP M4.