Startseite › Katalog › Bestes LLM für den Mac mini M2 / M2 Pro im Jahr 2026

Bestes LLM für den Mac mini M2 / M2 Pro im Jahr 2026

◆ Mac — Lokale KI auf Ihrem Mac, voll ausgereizt — Unified Memory, MLX, das richtige Modell für Ihren Chip · 24 € · oder alle Kits für 49 € →

Rangliste aktualisiert am 09/10/2026

Der Mac mini M2 / M2 Pro (8–32 GB, 100–200 GB/s) bleibt ein hervorragender, leiser Inferenzserver für 7–13B in Q4_K_M. Belüftet, kompakt, bereit 24/7.

Angebote und Alternativen für lokale KI

Vergleichen Sie die Preise für Mac mini M5 Pro (24 GB / 512 GB) bei unseren Partnerhändlern (verifizierte Produktseiten):

Warum diese Wahl? Unser umfassender Bericht zum Mac mini M5 Pro (24 GB / 512 GB) →

Welchen PC sollten Sie je nach Budget wählen? Unsere Auswahl von 800 bis 3 500 € →

Affiliate-Links — WelchesLLM kann eine Provision aus Käufen erhalten, ohne Mehrkosten für Sie; dies beeinflusst die unabhängig erstellte Rangliste nicht. Als Amazon-Partner erzielt WelchesLLM einen Gewinn aus qualifizierten Käufen.

Rangliste

1

🇺🇸 Granite 4.1 8B Instruct

IBM · 8 Mrd. Parameter · Apache 2.0 · Kontext: 131 072 Tokens

Dense 8B Apache 2.0, 12 Sprachen inkl. FR, 131k ctx, GQA 32Q/8KV. MMLU 73.84, HumanEval 85.37. Veröffentlichung 29. April 2026.

Warum dieser Rang Dense 8B Apache 2.0, 12 Sprachen inkl. FR, 131k ctx, GQA 32Q/8KV. MMLU 73.84, HumanEval 85.37. Veröffentlichung 29. April 2026.
# HuggingFace : ibm-granite/granite-4.1-8b
Auf Apple M2 (16 GB)
Q8
9 GB · 12 tok/s
2

🇺🇸 Granite 4.2 8B

IBM · 8 Mrd. Parameter · Apache 2.0 · Kontext: 128 000 Tokens

Granite 4.2 8B (IBM): Dichtes Modell unter Apache 2.0, 128k Kontext, ~4,6 GB VRAM bei Q4. Chat, Code und Reasoning in mehreren Sprachen für Unternehmen.

Warum dieser Rang Granite 4.2 8B (IBM): Dichtes Modell unter Apache 2.0, 128k Kontext, ~4,6 GB VRAM bei Q4. Chat, Code und Reasoning in mehreren Sprachen für Unternehmen.
ollama pull granite4.2
Auf Apple M2 (16 GB)
Q8
9 GB · 32 Tok/s
3

🇺🇸 OLMo 3 7B Think (SFT)

zimplex · 7 Mrd. Parameter · Apache 2.0 · 16 000 Tokens ctx

SFT-„thinking“-Variante von OLMo 3 7B: schrittweises Schlussfolgern, 16k Kontext, ca. 4,2 GB VRAM bei Q4. Zu 100 % offen, Apache-2.0-Lizenz.

Warum dieser Rang SFT-„thinking“-Variante von OLMo 3 7B: schrittweises Schlussfolgern, 16k Kontext, ca. 4,2 GB VRAM bei Q4. Zu 100 % offen, Apache-2.0-Lizenz.
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
Auf Apple M2 (16 GB)
Q8
8 GB · 32 Tok/s
4

🇨🇳 GLM 5.3 7B

Zhipu AI · 7 Mrd. Parameter · MIT · Kontext: 128 000 Tokens

GLM 5.3 (Zhipu): Dichtes 7B-Modell, spezialisiert auf Code und Reasoning, 128k Kontext, ~4,1 GB VRAM bei Q4. Leicht, läuft auf GPUs mit 6-8 GB, MIT-Lizenz.

Warum dieser Rang GLM 5.3 (Zhipu): Dichtes 7B-Modell, spezialisiert auf Code und Reasoning, 128k Kontext, ~4,1 GB VRAM bei Q4. Leicht, läuft auf GPUs mit 6-8 GB, MIT-Lizenz.
ollama pull glm-5.3
Auf Apple M2 (16 GB)
Q8
7 GB · 32 tok/s
5

🇺🇸 OLMo 3 7B

Allen AI · 7 Mrd. Parameter · Apache 2.0 · 8 192 Tokens ctx

Dichtes Modell mit 7B Parametern, zu 100 % offen (Gewichte + Daten + Code). Volle Transparenz für die Forschung.

Warum dieser Rang Dichtes Modell mit 7B Parametern, zu 100 % offen (Gewichte + Daten + Code). Volle Transparenz für die Forschung.
ollama run olmo-3:7b
Auf Apple M2 (16 GB)
Q8
9 GB · 12 tok/s
6

🇨🇳 Qwen 3 8B

Alibaba · 8 Mrd. Parameter · Apache 2.0 · Kontext: 131 072 Tokens

Hybrider Thinking/Fast-Modus. 119 Sprachen, 32k nativ (131k via YaRN).

Warum dieser Rang Hybrider Thinking/Fast-Modus. 119 Sprachen, 32k nativ (131k via YaRN).
ollama run qwen3:8b
Auf Apple M2 (16 GB)
Q8
9 GB · 12 tok/s
7

🇺🇸 Gemma 4 12B

Google · 12 Milliarden Parameter · Apache 2.0 · 262 144 tokens ctx

Gemma 4 12B (Google): Dichtes multimodales Modell (Text, Vision, Audio), 256k Kontext, ~7 GB VRAM Q4. Apache 2.0, mehrsprachig.

Warum dieser Rang Gemma 4 12B (Google): Dichtes multimodales Modell (Text, Vision, Audio), 256k Kontext, ~7 GB VRAM Q4. Apache 2.0, mehrsprachig.
# HuggingFace : google/gemma-4-12B
Auf Apple M2 (16 GB)
Q5_K_M
9 GB · 18 tok/s

Vergleichstabelle

Rang Modell Params VRAM Q4 Kontext Lizenz Auf Apple M2 (16 GB)
#1 Granite 4.1 8B Instruct 8B 5 GB 131 072 Apache 2.0 12 Tok/s · Q8
#2 Granite 4.2 8B 8B 4,6 GB 128 000 Apache 2.0 32 Tok/s · Q8
#3 OLMo 3 7B Think (SFT) 7B 4,2 GB 16 000 Apache 2.0 32 Tok/s · Q8
#4 GLM 5.3 7B 7B 4.1 GB 128 000 MIT 32 Tok/s · Q8
#5 OLMo 3 7B 7B 5 GB 8 192 Apache 2.0 12 Tok/s · Q8
#6 Qwen 3 8B 8B 5 GB 131 072 Apache 2.0 12 Tok/s · Q8
#7 Gemma 4 12B 12B 7 GB 262 144 Apache 2.0 18 tok/s · Q5_K_M
Das Mac-Kit

Lokale KI auf Ihrem Mac voll ausschöpfen: Unified Memory, MLX vs. GGUF, das passende Modell für Ihren Chip und auf Apple Silicon abgestimmte Einstellungen für Ollama und LM Studio.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Kostenloses Memo

Welches Code-Modell lässt sich auf IHREM Rechner ausführen?

Memo erhalten VRAM → bestes Code-Modell → Ollama-Befehl (alles auf einem Bildschirm, zum Kopieren und Einfügen). Und wechseln Sie zum Kit Copilote Local, um daraus ein wirklich funktionierendes Setup zu machen.

Das Kit „Copilote Local“ — die Ollama- + Cline- + Aider-Configs zum direkten Einfügen, angepasste Modelfiles, Hilfe bei Problemen, lebenslanger Zugang zum Onlinebereich →

Kein Spam. Abmeldung mit 1 Klick. Ihre Daten bleiben bei uns (werden nie weiterverkauft).

Methodik des Rankings

Filter: Modelle mit 1–32B, deren Q4_K_M-Version weniger als 22 GB benötigt (M2 Pro: maximal 32 GB). Bonus für 7–13B (Leistungsoptimum des M2 Pro) und freie Lizenzen für gemeinsam genutzte Server.

Berücksichtigte Kriterien:

  • Q4_K_M ≤ 22 GB
  • Leiser Server im 24/7-Betrieb
  • Verbrauch < 50 W im Leerlauf
  • Kompatibel mit Ollama / Open WebUI

Die Bewertung ist vollständig transparent: konsultieren Sie unsere Methodik für Details zur Berechnung des VRAM-Bedarfs und der Tokens pro Sekunde.

Häufige Fragen

Mac mini M2 8 GB: Relevant im Jahr 2026?

Phi-4 Mini 3,8B Q4 oder Llama 3.2 3B Q4 laufen – aber der Spielraum ist knapp. Wählen Sie nach Möglichkeit mindestens 16 GB. Siehe Leitfaden für Mac mini M2.

Mac mini M2 Pro 32 GB: Was ist der Sweet Spot?

Mistral Nemo 12B Q4 (~7 GB) oder Qwen 3 14B Q4 (~8 GB) – 22–28 Tok/s. Ein ausgezeichneter LLM-Server für zu Hause für 1–3 gleichzeitige Nutzer über die Ollama-API.

M2 Pro vs. M4 Pro für einen LLM-Server?

M4 Pro (273 GB/s) ist ~35-40 % schneller als M2 Pro (200 GB/s) bei den gleichen Modellen. Wenn man 2026 neu kauft, lohnt es sich, den M4 Pro zu wählen. Weitere Informationen in Mac mini M4.

Wie lässt sich ein Mac mini M2 als leiser Server konfigurieren?

Ollama + Open WebUI im LAN, Port 11434 hinter einem nginx-Reverse-Proxy. Automatischer Start über launchd. Im Leerlauf ~10 W, unter Last ~35 W. Leiser als ein ITX-PC.

Weiterführende Informationen

Die QuelLLM-Pakete Der maßgebliche Leitfaden für jeden Anwendungsfall
Alle Kits lebenslang — 49 €