Startseite › Katalog › Bestes LLM auf dem Mac mit 8 GB Unified Memory im Jahr 2026

Bestes LLM auf dem Mac mit 8 GB Unified Memory im Jahr 2026

◆ Mac — Lokale KI auf Ihrem Mac, voll ausgereizt — Unified Memory, MLX, das richtige Modell für Ihren Chip · 24 € · oder alle Kits für 49 € →

Rangliste aktualisiert am 09/10/2026

Auf einem Mac mit 8 GB (M1/M2/M3 Air, MacBook Air M4 in der Basiskonfiguration, Mac mini M2 in der Basiskonfiguration) belegt macOS etwa 4 GB. Für ein LLM bleiben etwa 3–4 GB nutzbar. Für einen flüssigen Betrieb beschränkt man sich auf Modelle mit 1–3 Milliarden Parametern in Q4_K_M.

Angebote und Alternativen für lokale KI

Vergleichen Sie die Preise für Mac mini M5 Pro (24 GB / 512 GB) bei unseren Partnerhändlern (verifizierte Produktseiten):

Warum diese Wahl? Unser umfassender Bericht zum Mac mini M5 Pro (24 GB / 512 GB) →

Welchen PC sollten Sie je nach Budget wählen? Unsere Auswahl von 800 bis 3 500 € →

Affiliate-Links — WelchesLLM kann an Käufen eine Provision erhalten, ohne zusätzliche Kosten für Sie; dies beeinflusst die unabhängig erstellte Rangliste nicht. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.

Rangliste

1

🇺🇸 Gemma 4 E2B

Google · 2B Parameter · Apache 2.0 · Kontext: 128 000 Tokens

Gemma 4 E2B: 2B effektive Parameter (5,1B insgesamt), ca. 3 GB VRAM bei Q4 (Ollama-Gewichte: 4,3 GB mit QAT, standardmäßig 7,2 GB). Multimodal mit Text und Bild, 128k Kontext, Apache 2.0.

Warum dieser Rang Gemma 4 E2B: 2B effektive Parameter (5,1B insgesamt), ca. 3 GB VRAM bei Q4 (Ollama-Gewichte: 4,3 GB mit QAT, standardmäßig 7,2 GB). Multimodal mit Text und Bild, 128k Kontext, Apache 2.0.
ollama run gemma4:e2b
Auf Apple M2 (16 GB)
FP16
10 GB · 20 Tok/s
2

🇺🇸 Granite 4.1 3B Instruct

IBM · 3 Milliarden Parameter · Apache 2.0 · Kontext: 131 072 Tokens

Dichtes 3B-Modell unter Apache 2.0, 12 Sprachen einschließlich Französisch, 131k ctx, GQA 40Q/8KV. Tool Calling und FIM für Code. Veröffentlicht am 29. April 2026.

Warum dieser Rang Dichtes 3B-Modell unter Apache 2.0, 12 Sprachen einschließlich Französisch, 131k ctx, GQA 40Q/8KV. Tool Calling und FIM für Code. Veröffentlicht am 29. April 2026.
ollama run granite4.1:3b
Auf Apple M2 (16 GB)
FP16
6 GB · 25 Tok/s
3

🇺🇸 Granite 4.1

IBM · 3 Milliarden Parameter · Apache 2.0 · Kontext: 128 000 Tokens

Granite 4.1 (3B, Apache 2.0): Generischer Ollama-Tag der Familie IBM Granite 4.1, 128k Kontext, Tool Calling und Code. Veröffentlicht im Mai 2026.

Warum dieser Rang Granite 4.1 (3B, Apache 2.0): Generischer Ollama-Tag der Familie IBM Granite 4.1, 128k Kontext, Tool Calling und Code. Veröffentlicht im Mai 2026.
ollama run granite4.1
Auf Apple M2 (16 GB)
FP16
6 GB · 50 Tok/s
4

🇺🇸 Granite 4.0 3B Vision

IBM · 3 Milliarden Parameter · Apache 2.0 · 16 384 Tokens ctx

3B-VLM, spezialisiert auf die Datenextraktion aus Unternehmensdokumenten. OCR, Tabellen, Formulare.

Warum dieser Rang 3B-VLM, spezialisiert auf die Datenextraktion aus Unternehmensdokumenten. OCR, Tabellen, Formulare.
# HuggingFace : ibm-granite/granite-4.0-3b-vision
Auf Apple M2 (16 GB)
FP16
6,5 GB · 25 tok/s
5

🇫🇷 SmolLM3 3B

HuggingFace · 3 Milliarden Parameter · Apache 2.0 · Kontext: 128 000 Tokens

3B mit zwei Modi (think/no-think). 6 Sprachen. MMLU 59,7, GSM8K 70,9. Vollständig offen (Daten + Trainingsrezept).

Warum dieser Rang 3B mit zwei Modi (think/no-think). 6 Sprachen. MMLU 59,7, GSM8K 70,9. Vollständig offen (Daten + Trainingsrezept).
# HuggingFace : HuggingFaceTB/SmolLM3-3B
Auf Apple M2 (16 GB)
FP16
6 GB · 25 Tok/s
6

🇨🇳 DeepSeek-OCR

DeepSeek · 3 Milliarden Parameter · MIT · 8 192 Tokens ctx

OCR-Spezialist mit 3B Parametern unter MIT-Lizenz. Gelobter Ansatz 'optical compression'. Basiert auf DeepEncoder.

Warum dieser Rang OCR-Spezialist mit 3B Parametern unter MIT-Lizenz. Gelobter Ansatz 'optical compression'. Basiert auf DeepEncoder.
ollama run deepseek-ocr:3b
Auf Apple M2 (16 GB)
FP16
6 GB · 25 Tok/s
7

🇨🇳 MiniCPM5 1B SFT

OpenBMB · 1,1 Milliarden Parameter · Apache 2.0 · 32 768 Tokens ctx

1.1B Apache 2.0 OpenBMB. Zweisprachiges SFT EN/ZH mit Tool-Calling, optimiert für die Ausführung direkt auf dem Gerät. VRAM in Q4 <1 GB für Smartphones und leistungsschwache Laptops.

Warum dieser Rang 1.1B Apache 2.0 OpenBMB. Zweisprachiges SFT EN/ZH mit Tool-Calling, optimiert für die Ausführung direkt auf dem Gerät. VRAM in Q4 <1 GB für Smartphones und leistungsschwache Laptops.
# HuggingFace : openbmb/MiniCPM5-1B-SFT
Auf Apple M2 (16 GB)
FP16
2,2 GB · 45 Tok/s

Vergleichstabelle

Rang Modell Params VRAM Q4 Kontext Lizenz Auf Apple M2 (16 GB)
#1 Gemma 4 E2B 2B 3 GB 128 000 Apache 2.0 20 Tok/s · FP16
#2 Granite 4.1 3B Instruct 3B 2 GB 131 072 Apache 2.0 25 tok/s · FP16
#3 Granite 4.1 3B 1,7 GB 128 000 Apache 2.0 50 Tok/s · FP16
#4 Granite 4.0 3B Vision 3B 2,2 GB 16 384 Apache 2.0 25 tok/s · FP16
#5 SmolLM3 3B 3B 2 GB 128 000 Apache 2.0 25 tok/s · FP16
#6 DeepSeek-OCR 3B 2 GB 8 192 MIT 25 tok/s · FP16
#7 MiniCPM5 1B SFT 1.1B 0,6 GB 32 768 Apache 2.0 45 tok/s · FP16
Das Mac-Kit

Lokale KI auf Ihrem Mac voll ausschöpfen: Unified Memory, MLX vs. GGUF, das passende Modell für Ihren Chip und auf Apple Silicon abgestimmte Einstellungen für Ollama und LM Studio.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Kostenloses Memo

Welches Code-Modell lässt sich auf IHREM Rechner ausführen?

Memo erhalten VRAM → bestes Code-Modell → Ollama-Befehl (alles auf einem Bildschirm, zum Kopieren und Einfügen). Und wechseln Sie zum Kit Lokaler Copilot, um daraus ein wirklich funktionierendes Setup zu machen.

Das Kit „Lokaler Copilot“ — die Ollama- + Cline- + Aider-Configs zum direkten Einfügen, angepasste Modelfiles, Hilfe bei Problemen, lebenslanger Zugang zum Onlinebereich →

Kein Spam. Abmeldung mit 1 Klick. Ihre Daten bleiben bei uns (werden nie weiterverkauft).

Methodik des Rankings

Filter: Modelle mit 1–4B, die in Q4_K_M weniger als 4 GB benötigen (lässt 4 GB für macOS + Kontext übrig). Bonus für 1–3B (Spitzenbedarf 8 GB) und ≤ 2B (kein Swap). Phi-4 Mini, Llama 3.2 3B, Gemma 4 3B dominieren.

Berücksichtigte Kriterien:

  • Q4_K_M ≤ 4 GB
  • Kein Swap unter macOS
  • Tokens/sec ≥ 20
  • Nutzbarer Kontext: 2–4k

Die Bewertung ist vollständig transparent: konsultieren Sie unsere Methodik für Details zur Berechnung des VRAM-Bedarfs und der Tokens pro Sekunde.

Häufige Fragen

Kann ein Mac mit 8 GB wirklich ein LLM ausführen?

Ja, aber nur knapp. Phi-4 Mini 3,8B Q4 (~2,3 GB) oder Llama 3.2 3B Q4 (~2 GB) laufen mit 25-35 Tokens pro Sekunde. macOS benötigt 4 GB, Ihnen bleiben 2-3 GB frei — das ist knapp, aber für kurze Chats nutzbar.

Mac mini M2 8 GB vs MacBook Air M4 16 GB?

Der Air M4 16 GB ist deutlich vorteilhaft: 2× die RAM ermöglicht Modelle von 7–8 B ( Mistral, Qwen 3) mit viel größerer Leistung. Der Mini M2 8 GB erreicht im Komfort nicht mehr als 3 B. Weitere Informationen Mac 16 GB.

Welche Quantisierung auf 8 GB?

Q4_K_M bleibt der ideale Kompromiss. Mit Q3_K_M lässt sich ein Mistral 7B (~3,5 GB) im Speicher unterbringen, aber die Qualität nimmt merklich ab. Bevorzugen Sie ein 3B-Modell in Q4 mit ausreichend Speicher gegenüber einem durch Q3 qualitativ eingeschränkten 7B-Modell.

Muss man wirklich 16 GB haben, um lokal mit einem LLM zu starten?

Für den ernsthaften Einsatz ja — Apple hat übrigens 2025 bei allen M4-Macs die 8-GB-Varianten abgeschafft. Für gelegentliche Tests auf einem vorhandenen Mac reichen 8 GB aus, um mit 1–3B-Modellen erste Erfahrungen zu sammeln. Siehe MacBook Air M1.

Weiterführende Informationen

Die QuelLLM-Pakete Der maßgebliche Leitfaden für jeden Anwendungsfall
Alle Kits lebenslang — 49 €