Welcher LLM für Mac mini M2 / M2 Pro (8–32 GB)? ?
Ein Mac mini M2 oder M2 Pro eignet sich als leiser LLM-Server für zu Hause: Mit 16 GB vereinheitlichtem Speicher betreibt er ein 8–9B-Modell in Q4, mit 32 GB (nur beim M2 Pro) ein 24–32B-Modell oder ein MoE-Modell mit 30–35B. Entscheidend für den Nutzungskomfort ist die Speicherbandbreite: 100 GB/s beim M2 gegenüber 200 GB/s beim M2 Pro. Bei gleichem Modell generiert der M2 Pro fast doppelt so schnell. Vermeiden Sie die 8-GB-Version.
Der Mac mini M2 vom Januar 2023 wurde Ende 2024 durch den M4 ersetzt, ist aber auf dem Gebrauchtmarkt weiterhin weit verbreitet. Diese Seite erklärt, was jede Speicherkonfiguration tatsächlich ermöglicht, welche Werte die veröffentlichten Messungen in Tokens pro Sekunde ergeben, wie Sie ihn als Ollama-Server einrichten, der aus dem gesamten lokalen Netzwerk erreichbar ist, und ab wann ein neueres Modell vorzuziehen ist.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: Mac mini M5 Pro (24 GB / 512 GB).
Warum diese Wahl? Unsere vollständige Übersicht zu Mac mini M5 Pro (24 GB / 512 GB) →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#Mac mini M2 / M2 Pro im Jahr 2026: Was das Datenblatt verspricht
Apple stellte den Mac mini M2 im Januar 2023 mit „bis zu 24 GB gemeinsamem Arbeitsspeicher und 100 GB/s Bandbreite“ vor, den M2 Pro mit 200 GB/s, also der doppelten Bandbreite, und bis zu 32 GB Arbeitsspeicher. Apples technische Daten nennen die Standardkonfigurationen und die individuell konfigurierbaren Varianten: Der M2 startet mit 8 GB und lässt sich mit 16 oder 24 GB konfigurieren; der M2 Pro startet mit 16 GB und lässt sich mit 32 GB konfigurieren. Es gibt daher weder einen M2 mit 32 GB noch einen M2 Pro mit 8 GB. Der Arbeitsspeicher ist verlötet: Die Entscheidung fällt beim Kauf, nicht danach.
- Mac mini M2
- 8 CPU-Kerne, 10 GPU-Kerne, 100 GB/s, 8, 16 oder 24 GB vereinheitlichter Speicher.
- Mac mini M2 Pro
- 10 oder 12 CPU-Kerne, 16 oder 19 GPU-Kerne, 200 GB/s, 16 oder 32 GB.
- Kühlung
- Aktive Kühlung durch einen Lüfter: Apple kündigt ein Kühlsystem an, das für dauerhaft hohe Leistung ausgelegt ist. Das ist für einen Rechner wichtig, der den ganzen Tag Anfragen beantwortet.
- Verbrauch
- Laut dem offiziellen Datenblatt von Apple: 7 W im Leerlauf, maximal 50 W für den M2 und maximal 100 W für den M2 Pro. Die niedrigeren Werte, die man gelegentlich liest (10 bis 30 W), sind Nutzermessungen, keine Obergrenzen.
#M2 oder M2 Pro: Die Wahl hängt von der Bandbreite ab
Lokale KI auf Ihrem Mac voll ausschöpfen: Unified Memory, MLX vs. GGUF, das passende Modell für Ihren Chip und auf Apple Silicon abgestimmte Einstellungen für Ollama und LM Studio.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Bei der Textgenerierung muss der Chip für jedes Token sämtliche aktiven Modellgewichte erneut aus dem Speicher lesen. Die Geschwindigkeit ist daher durch die Bandbreite geteilt durch die Modellgröße begrenzt. Ein M2 mit 100 GB/s und ein Modell mit 5 GB ergeben eine theoretische Obergrenze von etwa 20 Tokens pro Sekunde; der M2 Pro mit 200 GB/s verdoppelt diese Obergrenze. Die Speicherkapazität entscheidet hingegen lediglich darüber, was hineinpasst: Ein 24B-Modell in Q4 (etwa 14 GB) lässt auf einem Rechner mit 16 GB keinen Speicher für das System übrig.
| Kriterium | Mac mini M2 | Mac mini M2 Pro |
|---|---|---|
| Bandbreite | 100 GB/s | 200 GB/s |
| Mögliche Speicherkapazität | 8, 16 oder 24 GB | 16 oder 32 GB |
| Komfortabler größere Nutzung | 8-9B bei Q4 mit 16 GB; 12-14B mit 24 GB | 24B bis 32B in Q4 mit 32 GB |
| Multi-User, RAG | Ein oder zwei Nutzer mit geringer Nutzung | Mehrere kurze Anfragen sind akzeptabel |
| Maximaler Verbrauch (Apple) | 50 W | 100 W |
Der M2 mit 24 GB ist die hybride Konfiguration: Er hat genug Speicherkapazität für ein 14B-Modell, behält aber die Bandbreite des M2. Er lädt daher größere Modelle als der M2 mit 16 GB, führt sie jedoch nicht schneller aus. Wählen Sie ihn, wenn Sie ein langes Kontextfenster oder zwei geladene Modelle möchten; andernfalls ist der M2 Pro mit 16 GB, der bei demselben Modell doppelt so schnell ist, für die interaktive Nutzung oft die bessere Wahl.
#Welches Modell für welche Speichergröße: die Berechnung, nicht das Versprechen
Nicht der gesamte Speicher steht dem GPU-Speicher zur Verfügung. Auf Apple Silicon begrenzt Metal standardmäßig den Anteil des vereinheitlichten Speichers, den die GPU nutzen kann, laut Diskussionen im llama.cpp-Repository auf zwei Drittel bis drei Viertel. Rechnen Sie auf einem Gerät mit 16 GB mit etwa 10 bis 12 GB für das Modell und seinen Kontext; der Rest bleibt macOS vorbehalten. Die Richtwerte dieser Website für die Modellgewichte in Q4 sind 8B ≈ 5 GB, 14B ≈ 9 GB, 32B ≈ 19–20 GB; der Kontextcache kommt noch hinzu.
| Modell (Q4) | Modellgröße | M2 8 GB | M2 16 GB | M2 24 GB / M2 Pro 16 GB | M2 Pro 32 GB |
|---|---|---|---|---|---|
| Qwen 3.5 4B | 2,3 GB | Ja | Ja | Ja | Ja |
| Granite 4.2 8B | 4,6 GB | Knapp | Ja | Ja | Ja |
| Qwen 3.5 9B | 6 GB | Nein | Ja | Ja | Ja |
| Gemma 4 12B | 7 GB | Nein | Knapp | Ja | Ja |
| Mistral Small 3.2 24B | 14 GB | Nein | Nein | Nein (24 GB: sehr knapp) | Ja |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | Nein | Nein | Nein | Ja, wenig Spielraum |
So lesen Sie die Tabelle: „Knapp“ bedeutet, dass die Modellgewichte in den Speicher passen, ein langer Kontext und macOS aber um den verbleibenden Speicher konkurrieren. Die Variante mit 8 GB scheidet für jeden ernsthaften Einsatz aus: macOS und der Browser belegen bereits die Hälfte des Arbeitsspeichers. Das MoE-Modell 35B-A3B ist ein Sonderfall: Es belegt 21 GB, aktiviert aber pro Token nur etwa 3 Milliarden Parameter und ist dadurch deutlich schneller als ein dichtes Modell gleicher Größe. Das ist der beste Grund, einen M2 Pro mit 32 GB zu wählen.
#Die gemessenen Durchsatzwerte: Welche Aussagen die veröffentlichte Quelle zulässt
Wir haben keine eigenen Messungen und präsentieren auch keine. Die nützlichste öffentliche Referenz ist die Diskussion „Performance of llama.cpp on Apple Silicon M-series“ im llama.cpp-Repository, in der Nutzer Messwerte zur Textgenerierung (tg128) eines Llama-7B-Modells auf den jeweiligen Apple-Chips veröffentlichen. Diese Zahlen wurden mit der damaligen Version von llama.cpp und einem älteren Modell als den heutigen ermittelt, vermitteln aber die Größenordnung.
| Chip | Bandbreite | Q4_0 | Q8_0 | F16 |
|---|---|---|---|---|
| M2, 10 GPU-Kerne | 100 GB/s | 21,91 t/s | 12,21 t/s | 6,72 t/s |
| M2 Pro, 16 GPU-Kerne | 200 GB/s | 37,87 t/s | 22,70 t/s | 12,47 t/s |
| M2 Pro, 19 GPU-Kerne | 200 GB/s | 38,86 t/s | 23,01 t/s | 13,06 t/s |
Diese Tabelle bestätigt drei Dinge. Erstens folgt die Geschwindigkeit der Größe der Gewichte: Der Wechsel von Q4_0 auf Q8_0 verringert den Durchsatz ungefähr um den Faktor 1,8. Zweitens ist der M2 Pro etwa 1,7-mal so schnell wie der M2 – der Geschwindigkeitsfaktor liegt damit etwas unter dem Faktor 2 bei der Bandbreite. Drittens ändern die zusätzlichen GPU-Kerne des M2 Pro mit 19 Kernen kaum etwas an der Generierung (38,86 gegenüber 37,87 t/s): Sie helfen bei der Prompt-Verarbeitung, nicht bei der Generierung.
#Kontext und Promptverarbeitung: die eigentliche Bremse
Tokens pro Sekunde sagen nicht alles aus. Zwei Größen beeinflussen das Nutzungserlebnis: die Verarbeitungszeit des Prompts (Spalte pp512 derselben Messungen: 201 t/s in F16 für den M2, 384 t/s für den M2 Pro mit 19 Kernen) und das Wachstum des Kontext-Caches. Bei einem Eingabedokument mit 20.000 Tokens dauert es auf jedem Mac dieser Generation mehrere Dutzend Sekunden, bis das erste Wort erscheint. Verwenden Sie für RAG oder die Dokumentenanalyse kurze Auszüge, statt ein ganzes PDF einzufügen.
Auch der Kontext-Cache beansprucht Speicher: Je länger das Kontextfenster ist, desto weniger bleibt für die Modellgewichte übrig. Bei 16 GB schafft eine Reduzierung des Fensters auf 8.000 oder 16.000 Tokens Platz für ein größeres Modell. Der Leitfaden zum Kontextfenster erläutert diese Regel im Detail, und der Leitfaden zum KV-Cache erklärt, wie sich dieser quantisieren lässt.
#Ollama als Server für den 24/7-Betrieb installieren: eine Vorgehensweise, die funktioniert
Ollama benötigt macOS Sonoma (14) oder neuer und lauscht standardmäßig auf 127.0.0.1, Port 11434: Es ist also nur vom Rechner selbst aus erreichbar. Um Ollama für andere Rechner zugänglich zu machen, muss die Adresse geändert werden, auf der es lauscht. Auf dem Mac gibt die offizielle FAQ-Dokumentation an, dass die Umgebungsvariablen mit launchctl gesetzt werden, wenn Ollama als Anwendung läuft; anschließend muss die Anwendung neu gestartet werden.
- 01Die Ollama-Anwendung installierenLaden Sie die Anwendung von der offiziellen Website herunter oder verwenden Sie Homebrew; die Installationsanleitung für macOS beschreibt beide Wege im Detail. Verwenden Sie die Anwendung und einen Homebrew-Dienst nicht gleichzeitig: Beide beanspruchen denselben Port.
- 02Die Listener-Adresse definierenFühren Sie in der Terminal-App launchctl setenv OLLAMA_HOST 0.0.0.0:11434 aus, beenden Sie dann die Anwendung Ollama und starten Sie sie erneut.
- 03Ruhezustand verhindernAktivieren Sie in den Systemeinstellungen unter „Energie sparen“ die Option, die den automatischen Ruhezustand bei ausgeschaltetem Bildschirm verhindert, und aktivieren Sie die automatische Anmeldung, wenn der Mac selbstständig neu starten soll.
- 04Eine feste IP-Adresse reservierenWeisen Sie dem Mac mini in Ihrem Router eine feste IP-Adresse zu, oder verwenden Sie den Namen mac-mini.local im lokalen Netzwerk.
- 05Modell vorladenLaden Sie das Modell mit ollama pull herunter und testen Sie anschließend von einem anderen Rechner mit dem folgenden curl-Befehl.
#Was der Mac mini dem ganzen Haushalt bereitstellt
Der Mac mini M2 ist kein Produktionsserver, eignet sich aber hervorragend für drei Anwendungen: einen Chat für die Familie, eine OpenAI-kompatible API für Ihre Tools und leichte Automatisierungen. Ollama unterstützt einen Teil der OpenAI-API auf demselben Port, sodass sich viele bestehende Clients allein durch eine Änderung der Adresse anbinden lassen; prüfen Sie, ob die von Ihnen benötigten Funktionen (Tools, strukturierte Ausgaben) abgedeckt sind.
- Chat
- Open WebUI oder eine Ollama-kompatible mobile Anwendung: Geben Sie die Adresse http://mac-mini.local:11434 in den Einstellungen ein.
- Code
- Continue, Aider oder Zed: Geben Sie die URL des Ollama-Servers als Anbieter an.
- Automatisierung
- n8n, Home Assistant oder iOS-Kurzbefehle: Sie können eine OpenAI-kompatible HTTP-API aufrufen.
- Dokumentenindexierung
- Ein leichtes Embedding-Modell wie nomic-embed-text lässt bei 16 GB Speicher noch Platz für ein Chat-Modell mit 8–9 Milliarden Parametern.
Eine Einschränkung sollten Sie kennen: Ollama verarbeitet standardmäßig nur eine Anfrage gleichzeitig pro Modell (OLLAMA_NUM_PARALLEL hat den Wert 1). Zwei Personen, die gleichzeitig eine Frage stellen, teilen sich daher den Durchsatz oder müssen warten, bis sie an der Reihe sind. Für eine Familie reicht das aus; für ein Team mit mehr als drei oder vier aktiven Personen ist ein leistungsstärkerer Rechner oder ein auf parallele Verarbeitung ausgelegter Inferenzserver besser geeignet.
#Mac mini M2 oder ein neueres Gerät: Wann wechseln?
Der Basis-M4 erreicht 120 GB/s (Wert aus der llama.cpp-Tabelle), der M4 Pro laut Apple 273 GB/s. Da die Bandbreite der begrenzende Faktor ist, beträgt der Geschwindigkeitsunterschied zwischen dem M2 und dem Basis-M4 etwa 20 % und ist zwischen dem M2 Pro und dem M4 Pro deutlich größer. Ein gebrauchter M2 Pro mit 32 GB bleibt sinnvoll, wenn Sie ein Modell mit 24 bis 32 Milliarden Parametern anstreben; für agentische Anwendungen oder Programmieraufgaben mit langen Kontexten sorgt ein aktueller Chip mit mehr Speicher für mehr Komfort.
| Situation | Empfehlung |
|---|---|
| Chat für die Familie mit 8–9B, knappes Budget | Ein gebrauchter M2 mit 16 GB reicht aus |
| Modell mit 24 bis 32B oder MoE-Modell mit 30–35B | M2 Pro 32 GB oder ein neuerer Mac mit 32 GB und mehr |
| Lange Kontexte, Agenten, mehrere Benutzer | Ein Mac mini M4 Pro oder ein leistungsstärkeres Modell |
| Bedarf an 64 GB oder mehr | Mac Studio, niemals ein Mac mini M2 |
- Mac mini M4 / M4 Pro: der Nachfolger
- Hardware-Daten: Mac mini M4 Pro
- macOS-Einstellungen für Apple Silicon
- Ollama auf macOS installieren
- Quelle: Apple, technische Spezifikationen des Mac mini (2023)
- Quelle: Apple, Stromverbrauch und Wärmeabgabe des Mac mini
- Quelle: llama.cpp-Messungen auf Apple-Chips
- Quelle: Offizielle Ollama-FAQ
#Häufig gestellte Fragen
Kann der Mac mini M2 24 Stunden am Tag als LLM-Server laufen?+
Welchen gebrauchten Mac mini M2 für lokale KI wählen?+
Wie viele Tokens pro Sekunde kann ein Mac mini M2 leisten?+
Kann man den Mac mini M2 von einem iPhone oder einem anderen Gerät aus nutzen?+
Ist der Mac mini M2 schneller als ein MacBook Air M2?+
Kann man ein Modell auf einem Mac mini M2 Pro feinabstimmen?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.