Einsteiger 12 Min.Mac mini

Welcher LLM für Mac mini M2 / M2 Pro (8–32 GB)? ?

Direkte Antwort

Ein Mac mini M2 oder M2 Pro eignet sich als leiser LLM-Server für zu Hause: Mit 16 GB vereinheitlichtem Speicher betreibt er ein 8–9B-Modell in Q4, mit 32 GB (nur beim M2 Pro) ein 24–32B-Modell oder ein MoE-Modell mit 30–35B. Entscheidend für den Nutzungskomfort ist die Speicherbandbreite: 100 GB/s beim M2 gegenüber 200 GB/s beim M2 Pro. Bei gleichem Modell generiert der M2 Pro fast doppelt so schnell. Vermeiden Sie die 8-GB-Version.

Der Mac mini M2 vom Januar 2023 wurde Ende 2024 durch den M4 ersetzt, ist aber auf dem Gebrauchtmarkt weiterhin weit verbreitet. Diese Seite erklärt, was jede Speicherkonfiguration tatsächlich ermöglicht, welche Werte die veröffentlichten Messungen in Tokens pro Sekunde ergeben, wie Sie ihn als Ollama-Server einrichten, der aus dem gesamten lokalen Netzwerk erreichbar ist, und ab wann ein neueres Modell vorzuziehen ist.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Getestet auf macOS 14+
Empfohlene Hardware

Kaufalternative für diesen Guide: Mac mini M5 Pro (24 GB / 512 GB).

Warum diese Wahl? Unsere vollständige Übersicht zu Mac mini M5 Pro (24 GB / 512 GB) →

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#Mac mini M2 / M2 Pro im Jahr 2026: Was das Datenblatt verspricht

Apple stellte den Mac mini M2 im Januar 2023 mit „bis zu 24 GB gemeinsamem Arbeitsspeicher und 100 GB/s Bandbreite“ vor, den M2 Pro mit 200 GB/s, also der doppelten Bandbreite, und bis zu 32 GB Arbeitsspeicher. Apples technische Daten nennen die Standardkonfigurationen und die individuell konfigurierbaren Varianten: Der M2 startet mit 8 GB und lässt sich mit 16 oder 24 GB konfigurieren; der M2 Pro startet mit 16 GB und lässt sich mit 32 GB konfigurieren. Es gibt daher weder einen M2 mit 32 GB noch einen M2 Pro mit 8 GB. Der Arbeitsspeicher ist verlötet: Die Entscheidung fällt beim Kauf, nicht danach.

Mac mini M2
8 CPU-Kerne, 10 GPU-Kerne, 100 GB/s, 8, 16 oder 24 GB vereinheitlichter Speicher.
Mac mini M2 Pro
10 oder 12 CPU-Kerne, 16 oder 19 GPU-Kerne, 200 GB/s, 16 oder 32 GB.
Kühlung
Aktive Kühlung durch einen Lüfter: Apple kündigt ein Kühlsystem an, das für dauerhaft hohe Leistung ausgelegt ist. Das ist für einen Rechner wichtig, der den ganzen Tag Anfragen beantwortet.
Verbrauch
Laut dem offiziellen Datenblatt von Apple: 7 W im Leerlauf, maximal 50 W für den M2 und maximal 100 W für den M2 Pro. Die niedrigeren Werte, die man gelegentlich liest (10 bis 30 W), sind Nutzermessungen, keine Obergrenzen.
i
Warum der M2 als Server weiterhin eine ernstzunehmende Option ist
Der Hauptvorteil liegt nicht in der reinen Geschwindigkeit, sondern in der Kombination aus Geräuschpegel, Platzbedarf und Stromverbrauch im Leerlauf: laut Apple 7 W im Leerlauf. Ein Rechner, der täglich zehn Minuten lang antwortet und die übrige Zeit im Ruhezustand verbringt, verursacht sehr geringe Betriebskosten. Für die Geschwindigkeit ist die Bandbreite entscheidend.

#M2 oder M2 Pro: Die Wahl hängt von der Bandbreite ab

Das Mac-Kit

Lokale KI auf Ihrem Mac voll ausschöpfen: Unified Memory, MLX vs. GGUF, das passende Modell für Ihren Chip und auf Apple Silicon abgestimmte Einstellungen für Ollama und LM Studio.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Bei der Textgenerierung muss der Chip für jedes Token sämtliche aktiven Modellgewichte erneut aus dem Speicher lesen. Die Geschwindigkeit ist daher durch die Bandbreite geteilt durch die Modellgröße begrenzt. Ein M2 mit 100 GB/s und ein Modell mit 5 GB ergeben eine theoretische Obergrenze von etwa 20 Tokens pro Sekunde; der M2 Pro mit 200 GB/s verdoppelt diese Obergrenze. Die Speicherkapazität entscheidet hingegen lediglich darüber, was hineinpasst: Ein 24B-Modell in Q4 (etwa 14 GB) lässt auf einem Rechner mit 16 GB keinen Speicher für das System übrig.

M2 oder M2 Pro für einen LLM-Server
KriteriumMac mini M2Mac mini M2 Pro
Bandbreite100 GB/s200 GB/s
Mögliche Speicherkapazität8, 16 oder 24 GB16 oder 32 GB
Komfortabler größere Nutzung8-9B bei Q4 mit 16 GB; 12-14B mit 24 GB24B bis 32B in Q4 mit 32 GB
Multi-User, RAGEin oder zwei Nutzer mit geringer NutzungMehrere kurze Anfragen sind akzeptabel
Maximaler Verbrauch (Apple)50 W100 W

Der M2 mit 24 GB ist die hybride Konfiguration: Er hat genug Speicherkapazität für ein 14B-Modell, behält aber die Bandbreite des M2. Er lädt daher größere Modelle als der M2 mit 16 GB, führt sie jedoch nicht schneller aus. Wählen Sie ihn, wenn Sie ein langes Kontextfenster oder zwei geladene Modelle möchten; andernfalls ist der M2 Pro mit 16 GB, der bei demselben Modell doppelt so schnell ist, für die interaktive Nutzung oft die bessere Wahl.

#Welches Modell für welche Speichergröße: die Berechnung, nicht das Versprechen

Nicht der gesamte Speicher steht dem GPU-Speicher zur Verfügung. Auf Apple Silicon begrenzt Metal standardmäßig den Anteil des vereinheitlichten Speichers, den die GPU nutzen kann, laut Diskussionen im llama.cpp-Repository auf zwei Drittel bis drei Viertel. Rechnen Sie auf einem Gerät mit 16 GB mit etwa 10 bis 12 GB für das Modell und seinen Kontext; der Rest bleibt macOS vorbehalten. Die Richtwerte dieser Website für die Modellgewichte in Q4 sind 8B ≈ 5 GB, 14B ≈ 9 GB, 32B ≈ 19–20 GB; der Kontextcache kommt noch hinzu.

Was je nach Speicherkapazität hineinpasst (Modellgewichte in Q4 laut QuelLLM-Katalog, ohne Kontextspeicher)
Modell (Q4)ModellgrößeM2 8 GBM2 16 GBM2 24 GB / M2 Pro 16 GBM2 Pro 32 GB
Qwen 3.5 4B2,3 GBJaJaJaJa
Granite 4.2 8B4,6 GBKnappJaJaJa
Qwen 3.5 9B6 GBNeinJaJaJa
Gemma 4 12B7 GBNeinKnappJaJa
Mistral Small 3.2 24B14 GBNeinNeinNein (24 GB: sehr knapp)Ja
Qwen 3.6 35B-A3B (MoE)21 GBNeinNeinNeinJa, wenig Spielraum

So lesen Sie die Tabelle: „Knapp“ bedeutet, dass die Modellgewichte in den Speicher passen, ein langer Kontext und macOS aber um den verbleibenden Speicher konkurrieren. Die Variante mit 8 GB scheidet für jeden ernsthaften Einsatz aus: macOS und der Browser belegen bereits die Hälfte des Arbeitsspeichers. Das MoE-Modell 35B-A3B ist ein Sonderfall: Es belegt 21 GB, aktiviert aber pro Token nur etwa 3 Milliarden Parameter und ist dadurch deutlich schneller als ein dichtes Modell gleicher Größe. Das ist der beste Grund, einen M2 Pro mit 32 GB zu wählen.

#Die gemessenen Durchsatzwerte: Welche Aussagen die veröffentlichte Quelle zulässt

Wir haben keine eigenen Messungen und präsentieren auch keine. Die nützlichste öffentliche Referenz ist die Diskussion „Performance of llama.cpp on Apple Silicon M-series“ im llama.cpp-Repository, in der Nutzer Messwerte zur Textgenerierung (tg128) eines Llama-7B-Modells auf den jeweiligen Apple-Chips veröffentlichen. Diese Zahlen wurden mit der damaligen Version von llama.cpp und einem älteren Modell als den heutigen ermittelt, vermitteln aber die Größenordnung.

Textgenerierung, Llama 7B, llama.cpp (Diskussion #4167)
ChipBandbreiteQ4_0Q8_0F16
M2, 10 GPU-Kerne100 GB/s21,91 t/s12,21 t/s6,72 t/s
M2 Pro, 16 GPU-Kerne200 GB/s37,87 t/s22,70 t/s12,47 t/s
M2 Pro, 19 GPU-Kerne200 GB/s38,86 t/s23,01 t/s13,06 t/s

Diese Tabelle bestätigt drei Dinge. Erstens folgt die Geschwindigkeit der Größe der Gewichte: Der Wechsel von Q4_0 auf Q8_0 verringert den Durchsatz ungefähr um den Faktor 1,8. Zweitens ist der M2 Pro etwa 1,7-mal so schnell wie der M2 – der Geschwindigkeitsfaktor liegt damit etwas unter dem Faktor 2 bei der Bandbreite. Drittens ändern die zusätzlichen GPU-Kerne des M2 Pro mit 19 Kernen kaum etwas an der Generierung (38,86 gegenüber 37,87 t/s): Sie helfen bei der Prompt-Verarbeitung, nicht bei der Generierung.

→
Die Berechnung selbst nachvollziehen
Für einen M2 mit 100 GB/s und einer Datei von 3,8 GB liegt die theoretische Obergrenze bei etwa 26 t/s; die obige Messung (21,91 t/s) entspricht etwa 84 % davon. Für ein 9B-Modell in Q4 mit etwa 6 GB ergibt dieselbe Berechnung eine Obergrenze von etwa 16 t/s auf dem M2 und 33 t/s auf dem M2 Pro, vor Verlusten. Dies sind Obergrenzen auf Basis veröffentlichter Messungen, keine garantierten Durchsatzraten.

#Kontext und Promptverarbeitung: die eigentliche Bremse

Tokens pro Sekunde sagen nicht alles aus. Zwei Größen beeinflussen das Nutzungserlebnis: die Verarbeitungszeit des Prompts (Spalte pp512 derselben Messungen: 201 t/s in F16 für den M2, 384 t/s für den M2 Pro mit 19 Kernen) und das Wachstum des Kontext-Caches. Bei einem Eingabedokument mit 20.000 Tokens dauert es auf jedem Mac dieser Generation mehrere Dutzend Sekunden, bis das erste Wort erscheint. Verwenden Sie für RAG oder die Dokumentenanalyse kurze Auszüge, statt ein ganzes PDF einzufügen.

Auch der Kontext-Cache beansprucht Speicher: Je länger das Kontextfenster ist, desto weniger bleibt für die Modellgewichte übrig. Bei 16 GB schafft eine Reduzierung des Fensters auf 8.000 oder 16.000 Tokens Platz für ein größeres Modell. Der Leitfaden zum Kontextfenster erläutert diese Regel im Detail, und der Leitfaden zum KV-Cache erklärt, wie sich dieser quantisieren lässt.

#Ollama als Server für den 24/7-Betrieb installieren: eine Vorgehensweise, die funktioniert

Ollama benötigt macOS Sonoma (14) oder neuer und lauscht standardmäßig auf 127.0.0.1, Port 11434: Es ist also nur vom Rechner selbst aus erreichbar. Um Ollama für andere Rechner zugänglich zu machen, muss die Adresse geändert werden, auf der es lauscht. Auf dem Mac gibt die offizielle FAQ-Dokumentation an, dass die Umgebungsvariablen mit launchctl gesetzt werden, wenn Ollama als Anwendung läuft; anschließend muss die Anwendung neu gestartet werden.

  1. 01
    Die Ollama-Anwendung installieren
    Laden Sie die Anwendung von der offiziellen Website herunter oder verwenden Sie Homebrew; die Installationsanleitung für macOS beschreibt beide Wege im Detail. Verwenden Sie die Anwendung und einen Homebrew-Dienst nicht gleichzeitig: Beide beanspruchen denselben Port.
  2. 02
    Die Listener-Adresse definieren
    Führen Sie in der Terminal-App launchctl setenv OLLAMA_HOST 0.0.0.0:11434 aus, beenden Sie dann die Anwendung Ollama und starten Sie sie erneut.
  3. 03
    Ruhezustand verhindern
    Aktivieren Sie in den Systemeinstellungen unter „Energie sparen“ die Option, die den automatischen Ruhezustand bei ausgeschaltetem Bildschirm verhindert, und aktivieren Sie die automatische Anmeldung, wenn der Mac selbstständig neu starten soll.
  4. 04
    Eine feste IP-Adresse reservieren
    Weisen Sie dem Mac mini in Ihrem Router eine feste IP-Adresse zu, oder verwenden Sie den Namen mac-mini.local im lokalen Netzwerk.
  5. 05
    Modell vorladen
    Laden Sie das Modell mit ollama pull herunter und testen Sie anschließend von einem anderen Rechner mit dem folgenden curl-Befehl.
Konfiguration und Test
# Sur le Mac mini
launchctl setenv OLLAMA_HOST "0.0.0.0:11434"
# quitter puis relancer l'application Ollama
ollama pull qwen3:8b

# Depuis un autre poste du réseau local
curl http://mac-mini.local:11434/api/chat -d '{"model":"qwen3:8b","stream":false,"messages":[{"role":"user","content":"Bonjour"}]}'
!
Die API zugänglich machen: eine Sicherheitsentscheidung
Ollama hat keine Authentifizierung. Auf 0.0.0.0 zu lauschen, eignet sich für ein vertrauenswürdiges Heimnetzwerk; für Zugriffe von außen sollten Sie niemals eine Weiterleitung für Port 11434 auf Ihrem Router einrichten. Nutzen Sie ein VPN oder einen Reverse Proxy mit Authentifizierung. Standardmäßig bleibt ein Modell nach der letzten Anfrage noch 5 Minuten im Speicher: Passen Sie OLLAMA_KEEP_ALIVE an, wenn Ihnen der erste Aufruf des Tages langsam erscheint.

#Was der Mac mini dem ganzen Haushalt bereitstellt

Der Mac mini M2 ist kein Produktionsserver, eignet sich aber hervorragend für drei Anwendungen: einen Chat für die Familie, eine OpenAI-kompatible API für Ihre Tools und leichte Automatisierungen. Ollama unterstützt einen Teil der OpenAI-API auf demselben Port, sodass sich viele bestehende Clients allein durch eine Änderung der Adresse anbinden lassen; prüfen Sie, ob die von Ihnen benötigten Funktionen (Tools, strukturierte Ausgaben) abgedeckt sind.

Chat
Open WebUI oder eine Ollama-kompatible mobile Anwendung: Geben Sie die Adresse http://mac-mini.local:11434 in den Einstellungen ein.
Code
Continue, Aider oder Zed: Geben Sie die URL des Ollama-Servers als Anbieter an.
Automatisierung
n8n, Home Assistant oder iOS-Kurzbefehle: Sie können eine OpenAI-kompatible HTTP-API aufrufen.
Dokumentenindexierung
Ein leichtes Embedding-Modell wie nomic-embed-text lässt bei 16 GB Speicher noch Platz für ein Chat-Modell mit 8–9 Milliarden Parametern.

Eine Einschränkung sollten Sie kennen: Ollama verarbeitet standardmäßig nur eine Anfrage gleichzeitig pro Modell (OLLAMA_NUM_PARALLEL hat den Wert 1). Zwei Personen, die gleichzeitig eine Frage stellen, teilen sich daher den Durchsatz oder müssen warten, bis sie an der Reihe sind. Für eine Familie reicht das aus; für ein Team mit mehr als drei oder vier aktiven Personen ist ein leistungsstärkerer Rechner oder ein auf parallele Verarbeitung ausgelegter Inferenzserver besser geeignet.

#Mac mini M2 oder ein neueres Gerät: Wann wechseln?

Der Basis-M4 erreicht 120 GB/s (Wert aus der llama.cpp-Tabelle), der M4 Pro laut Apple 273 GB/s. Da die Bandbreite der begrenzende Faktor ist, beträgt der Geschwindigkeitsunterschied zwischen dem M2 und dem Basis-M4 etwa 20 % und ist zwischen dem M2 Pro und dem M4 Pro deutlich größer. Ein gebrauchter M2 Pro mit 32 GB bleibt sinnvoll, wenn Sie ein Modell mit 24 bis 32 Milliarden Parametern anstreben; für agentische Anwendungen oder Programmieraufgaben mit langen Kontexten sorgt ein aktueller Chip mit mehr Speicher für mehr Komfort.

Wann bleibt man bei M2, wann wechselt man
SituationEmpfehlung
Chat für die Familie mit 8–9B, knappes BudgetEin gebrauchter M2 mit 16 GB reicht aus
Modell mit 24 bis 32B oder MoE-Modell mit 30–35BM2 Pro 32 GB oder ein neuerer Mac mit 32 GB und mehr
Lange Kontexte, Agenten, mehrere BenutzerEin Mac mini M4 Pro oder ein leistungsstärkeres Modell
Bedarf an 64 GB oder mehrMac Studio, niemals ein Mac mini M2

#Häufig gestellte Fragen

FAQ
Kann der Mac mini M2 24 Stunden am Tag als LLM-Server laufen?+
Ja, er ist dafür ausgelegt, eingeschaltet zu bleiben: Apple gibt einen Verbrauch von 7 W im Leerlauf an, und ein aktiver Lüfter ermöglicht anhaltende Lasten. Entscheidend ist, den automatischen Ruhezustand zu verhindern. Bei intensiver Inferenz steigt der Verbrauch, aber Apple gibt maximal 50 W für den M2 und 100 W für den M2 Pro an.
Welchen gebrauchten Mac mini M2 für lokale KI wählen?+
Den M2 Pro mit 32 GB, wenn Sie Modelle mit 24 bis 32 Milliarden Parametern oder ein MoE mit 30 bis 35 Milliarden Parametern anstreben; den M2 mit 16 GB für Modelle mit 8 bis 9 Milliarden Parametern zum besten Preis. Vermeiden Sie die Variante mit 8 GB: macOS verbraucht bereits die Hälfte davon. Da der Arbeitsspeicher verlötet ist, prüfen Sie vor dem Kauf die genaue Konfiguration unter „Über diesen Mac“.
Wie viele Tokens pro Sekunde kann ein Mac mini M2 leisten?+
Die im llama.cpp-Repository veröffentlichten Messungen ergeben 21,9 Tokens/s auf dem M2 und 37,9 bis 38,9 Tokens/s auf dem M2 Pro für ein Llama 7B in Q4_0. Rechnen Sie bei einem 9B-Modell in Q4 mit niedrigeren Werten. Es handelt sich um Messungen von Nutzern, die als grobe Orientierung dienen.
Kann man den Mac mini M2 von einem iPhone oder einem anderen Gerät aus nutzen?+
Ja. Sobald OLLAMA_HOST auf 0.0.0.0:11434 gesetzt ist, kann sich jeder mit Ollama oder OpenAI kompatible Client im lokalen Netzwerk damit verbinden, einschließlich iOS-Anwendungen, die nach der Serveradresse fragen. Machen Sie den Server jedoch nicht ohne VPN oder Reverse-Proxy mit Authentifizierung über das Internet zugänglich, da die API von Ollama selbst keine Authentifizierung bietet.
Ist der Mac mini M2 schneller als ein MacBook Air M2?+
Bei identischem Chip ist die Bandbreite gleich, daher liegen die maximalen Durchsatzraten nahe beieinander. Der Vorteil des Mac mini ist die aktive Kühlung durch einen Lüfter: Er hält die Last durch, ohne seine Taktfrequenz zu senken, während ein MacBook Air ohne Lüfter bei langen Generierungen schließlich langsamer wird.
Kann man ein Modell auf einem Mac mini M2 Pro feinabstimmen?+
Bei einem kleinen Modell ist LoRA-Fine-Tuning über MLX möglich, aber langsam: Rechnen Sie je nach Größe des Datensatzes mit mehreren Stunden. Vollständiges Fine-Tuning ist mit 32 GB Speicher, der mit macOS geteilt wird, nicht praktikabel. Am sinnvollsten ist es, den Mac mini für die Inferenz zu nutzen und für das Training bei Bedarf eine GPU zu mieten.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.