🇺🇸 Laguna XS.2
MoE mit 33B/3B aktiven Parametern unter Apache 2.0, Spezialist für agentisches Programmieren. 68,2 % SWE-Bench Verified, 128k ctx. Läuft auf einem Mac mit 36 GB. Veröffentlichung am 28. April 2026.
ollama run laguna-xs.2
Ranking aktualisiert am 22.09.2026
128 GB vereinheitlichter Speicher entsprechen der Premium-Stufe einer KI-Workstation – und diese ist nicht mehr auf Desktop-Rechner beschränkt: Das MacBook Pro mit 14 oder 16 Zoll erreicht sie sowohl mit M5 Max als auch mit M4 Max, sofern Sie die GPU-Variante mit 40 Kernen wählen (614 GB/s beim M5 Max gegenüber 460 GB/s bei der Variante mit 32 Kernen). Llama 70B in Q8 (~75 GB), MoE 150B in Q4, 200k Kontext für RAG im Unternehmen.
Vergleichen Sie die Preise für MacBook Pro M5 Pro — 24 GB / 1 TB bei unseren Partnerhändlern (verifizierte Produktseiten):
Welchen PC sollten Sie je nach Budget wählen? Unsere Auswahl von 800 bis 3 500 € →
Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass Ihnen Mehrkosten entstehen. Dies beeinflusst die unabhängig erstellte Rangliste nicht. Als Amazon-Partner verdient QuelLLM an qualifizierten Käufen.
MoE mit 33B/3B aktiven Parametern unter Apache 2.0, Spezialist für agentisches Programmieren. 68,2 % SWE-Bench Verified, 128k ctx. Läuft auf einem Mac mit 36 GB. Veröffentlichung am 28. April 2026.
ollama run laguna-xs.2
GLM-4.7-Flash (MoE mit 31B Parametern, davon ~3B aktiv): das beste Verhältnis von Code-Leistung zu VRAM-Bedarf in der 30B-Klasse. MIT, 128k ctx, sehr schnell auf 3090/4090.
ollama run glm-4.7-flash
Hybrid aus Mamba-2 und MoE mit 32B Parametern, davon 9B aktiv. ~70 % weniger RAM bei langem Kontext. Apache 2.0.
ollama run granite4:small-h
MoE mit 35B Parametern, davon 3B aktiv, für agentisches Coding. 73,4 % SWE-Bench. Veröffentlicht am 16. April 2026.
ollama run qwen3.6:35b-a3b
MoE mit 30B Parametern, davon 3B aktiv, und Hybrid-Thinking. MMLU 81,4, AIME24 80,4. 100+ Sprachen.
ollama run qwen3:30b-a3b
MoE mit 30B/3B aktiven Parametern: Thinking-Modus + Instruct. Goldmedaille bei der IMO 2025 und der IOI 2025. Schnelle Inferenz dank 3B aktiver Parameter, Reasoning-Fähigkeiten auf 30B-Niveau. Veröffentlichung im April 2026.
ollama run nemotron-cascade-2
MoE 30B (3,3B aktive Parameter), spezialisiert auf agentisches Coding. Sehr schnell lokal, 256k nativer Kontext, die Referenz für 16–24 GB via Ollama.
ollama run qwen3-coder:30b
Vision-MoE mit 30B Parametern, davon 3B aktiv. Sweet Spot für Vision mit Qwen 3. 256k ctx.
ollama run qwen3-vl:30b
| Rang | Modell | Params | VRAM Q4 | Kontext | Lizenz | Auf Apple M5 Max (128 GB) |
|---|---|---|---|---|---|---|
| #1 | Laguna XS.2 | 33B | 19 GB | 131 072 | Apache 2.0 | 100 Tok/s · FP16 |
| #2 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT | 100 Tok/s · FP16 |
| #3 | Granite 4.0 H-Small 32B-A9B | 32B | 19 GB | 128 000 | Apache 2.0 | 75 Tok/s · FP16 |
| #4 | Qwen 3.6 35B-A3B | 35B | 21 GB | 262 000 | Apache 2.0 | 60 tok/s · FP16 |
| #5 | Qwen 3 30B-A3B | 30B | 19 GB | 131 072 | Apache 2.0 | 100 Tok/s · FP16 |
| #6 | Nemotron Cascade 2 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA Open Model License | 80 Tok/s · FP16 |
| #7 | Qwen3-Coder 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 100 Tok/s · FP16 |
| #8 | Qwen 3 VL 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 100 Tok/s · FP16 |
Lokale KI auf Ihrem Mac voll ausschöpfen: Unified Memory, MLX vs. GGUF, das passende Modell für Ihren Chip und auf Apple Silicon abgestimmte Einstellungen für Ollama und LM Studio.
Kostenloses Memo
Memo erhalten VRAM → bestes Code-Modell → Ollama-Befehl (alles auf einem Bildschirm, zum Kopieren und Einfügen). Und wechseln Sie zum Kit Copilote Local, um daraus ein wirklich funktionierendes Setup zu machen.
Das Kit „Copilote Local“ — die Ollama- + Cline- + Aider-Configs zum direkten Einfügen, angepasste Modelfiles, Hilfe bei Problemen, lebenslanger Zugang zum Onlinebereich →Kein Spam. Abmeldung mit 1 Klick. Ihre Daten bleiben bei uns (werden nie weiterverkauft).
Ihre Karte → das beste Code-Modell für die lokale Ausführung und der exakte Ollama-Befehl:
| Ihr VRAM | Typische GPUs / Macs | Empfohlenes Code-Modell | Ollama-Befehl |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) oder Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — Code-Agent-Spezialist | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — „nahe an Copilot“ | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — schnelles MoE | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — das ist in diesem speziellen Fall immer noch der Referenzstandard. ⚠️ Qwen 3.8: sein Reasoning ist standardmäßig sehr hoch eingestellt, und es „denkt“ bei einfachen Anfragen zu viel nach — stellen Sie es auf low (oder schalten Sie es ab) beim ersten Start. ⚠️ Lizenzfalle: Codestral 22B = Mistral Non-Production License → zum Programmieren bei der Arbeit verboten. Qwen 3.5/3.8, Gemma 4 und Devstral sind unter Apache 2.0 lizenziert. 💡 Abstürze wegen Speicherproblemen? Halten Sie ca. 1,5 GB VRAM für den Kontext frei oder gehen Sie eine Quantisierungsstufe herunter.🔌 Zum Einbinden in VS Code: Cline (Agent für mehrere Dateien), Aider (CLI) oder Tabby/Twinny (FIM-Autovervollständigung) — alle verbinden sich lokal mit Ollama. Das Kit Lokaler Copilot — Configs zum Einfügen + getestetes Setup — ist verfügbar: /copilote-local.
Filter: Modelle mit 30–250 Milliarden Parametern, die in Q4_K_M unter 96 GB bleiben (lässt 32 GB für macOS und einen sehr großen Kontext frei). Bonus: 70–150 Milliarden Parameter (Spitzenbedarf 128 GB) und MoE bis zu 250 Milliarden Parametern.
Berücksichtigte Kriterien:
Die Bewertung ist vollständig transparent: konsultieren Sie unsere Methodik für Details zur Berechnung des VRAM-Bedarfs und der Tokens pro Sekunde.
Mac 128 GB: Llama 70B Q8 oder 123B Q5?
Llama 70B Q8 (~75 GB) bei 10–14 Tokens/sec auf M4 Max. Mistral Large 123B Q5 (~85 GB) bei 8–12 Tokens/sec. Q8 auf 70B ist in der Regel nützlicher (fast-FP16, leicht besser als Q6 anderswo). 123B bleibt im Gesamtbereich leistungsfähiger.
Frontier MoE mit 128 GB: machbar?
DeepSeek V4 Flash 284B (MoE mit 13B aktiven Parametern) Q3_K_M (~140 GB) passt nicht in den Speicher — ein Mac Studio mit mindestens 192 GB ist erforderlich. Granite 4 Mamba 150B Q4 (~80 GB) passt in den Speicher. Für Frontier-Modelle ab 200B wechseln Sie zu Mac Studio Ultra.
MacBook Pro M5 Max 128 GB: Echt 128 GB in einem Laptop?
Ja, und es ist der einzige Laptop auf dem Markt in dieser Klasse. Das MacBook Pro mit 14 und 16 Zoll bietet sowohl mit M5 Max als auch mit M4 Max bis zu 128 GB vereinheitlichten Speicher, allerdings nur in der Variante mit 40 GPU-Kernen – beim M5 Max ist dies zugleich die einzige Variante mit 614 GB/s (460 GB/s bei der Variante mit 32 Kernen). Llama 70B Q8 + 128k Kontext unterwegs, ohne Cloud. Siehe die Seite des MacBook Pro M5 Max.
Mac 128 GB vs. Server 2× H100 80 GB?
2× H100 = ca. 10× schneller bei 70B (1700 GB/s pro Karte gegenüber 546 GB/s beim gemeinsamen Speicher). Allerdings ca. 80.000 € + 1 kW gegenüber einem Mac mit 128 GB für ca. 5.000 € + 100 W. Für die private Nutzung oder kleine Teams ist der Mac beim Preis pro GB klar überlegen.