Welcher LLM für Mac mini M4 / M4 Pro (16–64 GB)? ?
Auf einem Mac mini M4 lässt sich bereits mit 16 GB ein lokales LLM gut betreiben: Modelle mit 7 bis 12 Milliarden Parametern erreichen bei einem 7B-Modell in Q4_0 bestenfalls etwa zwanzig Tokens/s, da die Speicherbandbreite von 120 GB/s die Geschwindigkeit begrenzt. Für Modelle mit 14 bis 35 Milliarden Parametern benötigen Sie einen M4 Pro (273 GB/s, 24 bis 64 GB). Apple hat diese Baureihe im August 2026 durch die Mac mini M6 und M5 Pro ersetzt.
Dieser Leitfaden nutzt die Zahlen von Apple und llama.cpp sowie aus den Dokumentationen von Ollama und LM Studio als Entscheidungshilfe: welcher Chip, wie viel Speicher, welches Modell und welche Geschwindigkeit zu erwarten ist. Er unterscheidet zwischen Apples Angaben, Messungen der Community und bloßen Berechnungen und gibt einen Überblick über die im September 2026 erschienene Modellreihe mit M6 und M5 Pro.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: Mac mini M5 Pro (24 GB / 512 GB).
Warum diese Wahl? Unsere vollständige Übersicht zu Mac mini M5 Pro (24 GB / 512 GB) →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#Mac mini M4 und lokale LLMs: Was der Rechner kann
Ein Mac mini eignet sich gut als lokaler LLM-Server, weil sein gemeinsamer Speicher von Prozessor und GPU genutzt wird, ohne separaten VRAM. Zwei Kennzahlen bestimmen, was Sie damit machen können. Die Kapazität (16 bis 64 GB je nach Chip) bestimmt die Größe des Modells, das geladen werden kann: 7 bis 12 Milliarden Parameter bei 16 GB, 24 bis 35 Milliarden bei 32 bis 48 GB. Die Bandbreite bestimmt die Geschwindigkeit: laut Apple 120 GB/s beim M4-Chip und 273 GB/s beim M4 Pro. Ein LLM liest seine Gewichte für jedes erzeugte Token erneut ein, sodass der maximale Durchsatz ungefähr der Bandbreite geteilt durch die Größe der Gewichte entspricht. Für ein 7B-Modell in Q4_0 nennt die öffentliche Tabelle von llama.cpp 24,1 Tokens/s für einen M4 und etwa 50 für einen M4 Pro. Apple hat im August 2026 Mac mini mit M6 und M5 Pro vorgestellt, die diese Baureihe ersetzen; der M4 war Ende August noch bei einigen Händlern erhältlich.
- Mac mini M4
- CPU 10 Kerne, GPU 10 Kerne, 120 GB/s, 16 GB gemeinsamer Speicher (24 oder 32 GB optional), Thunderbolt 4.
- Mac mini M4 Pro
- CPU 12 Kerne, GPU 16 Kerne (14 und 20 optional), 273 GB/s, 24 GB Speicher (48 oder 64 GB optional), Thunderbolt 5.
- Abmessungen und Geräuschentwicklung
- 12,7 × 12,7 × 5,0 cm, 0,67 kg (M4) oder 0,73 kg (M4 Pro); 5 dBA im Ruhezustand, gemäß Apple.
- Angegebener Stromverbrauch
- M4: 4 W im Leerlauf, maximal 65 W. M4 Pro: 5 W und 140 W. Apple veröffentlicht keinen Wert für den Inferenzbetrieb.
#Mac mini M4 oder M4 Pro: Die Bandbreite ist entscheidend
Sie wissen, welches Modell auf Ihren Mac mini M4 passt. Das Mac-Kit zeigt Ihnen, wie Sie das Maximum herausholen: die GPU-Speichergrenze weiter hinausschieben (Kap. 2), zwischen MLX und GGUF wählen (Kap. 3) und Ihren Mac mini zu einem KI-Server für das ganze Haus machen (Kap. 12).
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Der wesentliche Unterschied zwischen den beiden Chips liegt nicht in der maximalen Speicherkapazität (32 GB gegenüber 64 GB), sondern in der um den Faktor 2,3 höheren Bandbreite (273 ÷ 120). In der Tabelle von llama.cpp beträgt das gemessene Verhältnis bei der Generierung 2,1 (50,7 ÷ 24,1 bei Q4_0) und beim Lesen des Prompts 2,0 (440 ÷ 221).
| Kriterium | Mac mini M4 | Mac mini M4 Pro |
|---|---|---|
| Speicherbandbreite (Apple) | 120 GB/s | 273 GB/s |
| Gemeinsamer Arbeitsspeicher (Apple) | 16 GB, optional 24 oder 32 GB | 24 GB, Option 48 oder 64 GB |
| Generierung, Llama 2 7B in Q4_0 (llama.cpp) | 24,1 Tokens pro Sekunde | 50,7 Tokens/s (GPU mit 20 Kernen) |
| Generierung, gleiches Modell in Q8_0 | 13,5 Tokens pro Sekunde | 30,7 Tokens/s |
| Verarbeitung des Prompts, Q4_0 | 221 Token/s | 440 Token/s |
| Thunderbolt-Ports (Apple) | Thunderbolt 4, 40 Gb/s | Thunderbolt 5, 120 Gb/s |
- Der M4 reicht aus, wenn
- Sie allein arbeiten, Modelle mit bis zu 12 Milliarden Parametern (Qwen 3.5 9B, Gemma 4 12B) anstreben und bestenfalls etwa zwanzig Tokens/s akzeptieren. Wählen Sie 24 GB, um zusätzlich ein Embedding-Modell geladen zu halten.
- Der M4 Pro ist die beste Wahl, wenn
- Sie möchten Modelle mit 14 bis 27 Milliarden Parametern, ein MoE mit 30 bis 35 Milliarden Parametern (mindestens 48 GB), einen Code-Agenten oder mehrere Benutzer unterstützen. Für mehr als 64 GB ist ein Mac Studio erforderlich.
#VRAM auf dem Mac mini: der vereinheitlichte Speicher und seine GPU-Obergrenze
Ein Mac mini hat keinen separaten VRAM, aber die GPU kann nicht den gesamten Arbeitsspeicher nutzen. Laut Nutzern von llama.cpp liegt die standardmäßige Obergrenze bei zwei Dritteln bis drei Vierteln des RAM; beim Start zeigt llama.cpp die Zeile recommendedMaxWorkingSetSize an, die den tatsächlichen Wert angibt. Die Einstellung iogpu.wired_limit_mb hat standardmäßig den Wert 0. Das bedeutet „Standardrichtlinie des Systems“ und nicht „unbegrenzt“.
| Speicher des Mac mini | Geschätztes GPU-Speicherlimit | Verbleibender Speicher für macOS |
|---|---|---|
| 16 GB | 10,7 bis 12 GB | 4 bis 5 GB |
| 24 GB | 16 bis 18 GB | 6 bis 8 GB |
| 32 GB | 21 bis 24 GB | 8 bis 11 GB |
| 48 GB | 32 bis 36 GB | 12 bis 16 GB |
| 64 GB | 43 bis 48 GB | 16 bis 21 GB |
Das Speicherlimit muss Platz für die Gewichte, den KV-Cache (den Kontextspeicher, der mit der Unterhaltung wächst) und die Rechenpuffer bieten. Um ein Modell zu laden, das knapp an die Grenze stößt, wird das Limit angehoben: MLX empfiehlt einen Wert oberhalb der Modellgröße in Megabyte, aber unterhalb der Speicherkapazität des Rechners. Lassen Sie mehrere Gigabyte für macOS frei, sonst bricht die Geschwindigkeit ein. Eine manuelle sysctl-Einstellung bleibt nach einem Neustart möglicherweise nicht erhalten.
#Welches Modell für welche Speicherkapazität: Was in den Speicher eines Mac mini passt
Die Tabelle vergleicht die Größe der von Ollama veröffentlichten Dateien mit einer Obergrenze von zwei Dritteln des Arbeitsspeichers (vorsichtige Annahme). „Ja“: Die Modellgewichte belegen weniger als 70 % dieser Obergrenze, sodass Platz für den KV-Cache bleibt. „Knapp“: Sie passen hinein, sofern der Kontext kurz ist. „Nein“: Sie überschreiten die Obergrenze. Das sind Berechnungen, keine Messungen.
| Modell | Modellgröße (Ollama) | M4 16 GB | M4 24 GB | M4 32 GB | M4 Pro 48 GB | M4 Pro 64 GB |
|---|---|---|---|---|---|---|
| Qwen 3.5 9B | 6,6 GB | ja | ja | ja | ja | ja |
| Gemma 4 12B | 7,6 GB | genau | ja | ja | ja | ja |
| gpt-oss 20B | 14 GB | nein | genau | ja | ja | ja |
| Mistral Small 24B | 14 GB | nein | genau | ja | ja | ja |
| Qwen 3.8 27B | 18 GB | nein | nein | genau | ja | ja |
| Qwen3-Coder 30B-A3B | 19 GB | nein | nein | genau | ja | ja |
| Qwen 3.6 35B-A3B (MoE) | 23 GB | nein | nein | nein | genau | ja |
| Qwen3-Coder 30B-A3B in Q8_0 | 32 GB | nein | nein | nein | genau | genau |
#Mac mini M4 mit 16 GB: empfehlenswerte Modelle
Bei 16 GB liegt die Obergrenze bei etwa 11 GB. Qwen 3.5 9B (6,6 GB bei Ollama) lässt etwa 4 GB für den KV-Cache und die Puffer übrig. Gemma 4 12B (7,6 GB) passt mit einem kurzen Kontext. Ein 14 GB großes Modell wie Mistral Small 24B überschreitet diese Grenze: Ollama verteilt es auf GPU und CPU, und die Geschwindigkeit sinkt. Der Befehl ollama ps zeigt die Verteilung an; streben Sie 100 % GPU an.
#Geschwindigkeit eines Mac mini: theoretischer Höchstwert und veröffentlichte Messwerte
Der Generierungsdurchsatz wird durch die Bandbreite begrenzt: Tokens pro Sekunde ≈ Bandbreite (GB/s) ÷ bei jedem Token gelesene Modellgewichte (GB). Diese Berechnung liefert eine Obergrenze, niemals einen Messwert. Für ein dichtes Modell mit 14 GB ergeben 120 ÷ 14 auf einem M4 bestenfalls 8,6 Tokens/s und 273 ÷ 14 auf einem M4 Pro 19,5 Tokens/s.
| Modell | Modellgröße | M4 (120 GB/s) | M4 Pro (273 GB/s) |
|---|---|---|---|
| Qwen 3.5 9B | 6,6 GB | 18 | 41 |
| Gemma 4 12B | 7,6 GB | 16 | 36 |
| Mistral Small 24B | 14 GB | 8,6 | 19,5 |
Die veröffentlichten Messwerte bleiben unter dieser Obergrenze. Hier folgen die Messwerte mit Llama 2 7B aus der Tabelle, die die llama.cpp-Community für Apple-Chips aktuell hält. Es sind nicht unsere Messungen, und sie beziehen sich auf ein älteres Modell in Q4_0 und Q8_0, zeigen aber das Verhältnis zwischen den Chips.
| Chip | Bandbreite | Generierung Q4_0 | Generierung Q8_0 | Prompt Q4_0 |
|---|---|---|---|---|
| M4 (GPU mit 10 Kernen) | 120 GB/s | 24,1 | 13,5 | 221 |
| M4 Pro (GPU mit 16 Kernen) | 273 GB/s | 49,6 | 30,5 | 364 |
| M4 Pro (GPU mit 20 Kernen) | 273 GB/s | 50,7 | 30,7 | 440 |
| M5 Pro (GPU mit 20 Kernen) | 307 GB/s | 66,3 | 38,9 | 1 621 |
Der Wechsel von Q8_0 zu Q4_0 beschleunigt die Generierung auf dem M4 um den Faktor 1,8 und auf dem M4 Pro um den Faktor 1,7: Die Dateigröße zählt mehr als der Rechenaufwand. Die GPU-Kerne beeinflussen vor allem das Einlesen des Prompts (364 gegenüber 440 Tokens/s auf dem M4 Pro). Zum Zeitpunkt der Einsichtnahme enthält die Tabelle keine M6-Messwerte.
#Mac mini M6 und M5 Pro: Was die neue Serie für ein LLM verändert
Apple gibt für den Mac mini M6 eine bis zu 4,8-mal so hohe Geschwindigkeit bei der Promptverarbeitung in LM Studio wie beim M4 an und für den M5 Pro eine bis zu 4-mal so hohe wie beim M4 Pro. Diese Zuwächse betreffen das Einlesen des Prompts, das von den neuronalen Beschleunigern profitiert, die jedem GPU-Kern hinzugefügt wurden. Die Generierung wird weiterhin durch die Bandbreite bestimmt und legt deutlich weniger zu: zwischen 12 % (307 gegenüber 273 GB/s) und 42 % (170 gegenüber 120 GB/s).
| Chip | Bandbreite | Unified Memory | Leerlauf / Maximum |
|---|---|---|---|
| M4 | 120 GB/s | 16, 24 oder 32 GB | 4 W / 65 W |
| M6 | 153 GB/s (16 GB), 170 GB/s (24 GB und mehr) | 16, 24 oder 32 GB | 4 W / 70 W |
| M4 Pro | 273 GB/s | 24, 48 oder 64 GB | 5 W / 140 W |
| M5 Pro | 307 GB/s | 24, 48 oder 64 GB | 6 W / 145 W |
Ein M6 in der Basisversion mit 153 GB/s hat nur 28 % mehr Bandbreite als der M4: Die theoretische Obergrenze für ein 9B-Modell steigt von 18 auf etwa 23 Tokens/s. Die neue Modellreihe kommt vor allem Anwendungen mit langem Kontext zugute: einem RAG-System, das lange Dokumente in den Kontext einfügt, oder einem Code-Agenten, der ein Repository erneut liest.
- Neugerät, Modell mit 30 bis 35 Milliarden Parametern
- Ein M5 Pro mit mindestens 48 GB, 64 GB für komfortables Arbeiten mit einem MoE von 35 Milliarden: Der M6 hat ein Limit von 32 GB.
- M4 noch verfügbar
- Sinnvoll für Modelle mit 7 bis 12 Milliarden Parametern, wenn der Preisunterschied zum M6 deutlich ist. Der Vorrat ist begrenzt.
#Einen LLM-Server auf einem Mac mini mit Ollama installieren
Ollama auf macOS funktioniert wie eine Anwendung, deren Einstellungen über durch launchctl definierte Umgebungsvariablen erfolgen. Standardmäßig hört Ollama nur auf 127.0.0.1, Port 11434: Ohne Änderung kann kein anderes Gerät es nutzen.
- 01Die Ollama-Anwendung installierenLaden Sie Ollama von ollama.com herunter und legen Sie die Anwendung im Ordner Applications ab. Beim ersten Start bietet sie an, eine Verknüpfung für den Befehl ollama zu erstellen.
- 02Den Port für das lokale Netzwerk öffnenSetzen Sie OLLAMA_HOST mit launchctl (Befehl unten) und starten Sie anschließend die Anwendung neu. Die Adresse 0.0.0.0 öffnet die API für das gesamte Netzwerk ohne Authentifizierung: Verwenden Sie sie nur in einem vertrauenswürdigen Netzwerk.
- 03Ruhezustand verhindernAktivieren Sie in den Systemeinstellungen im Bereich „Energie“ die Option, die den automatischen Ruhezustand bei ausgeschaltetem Bildschirm verhindert: Ohne diese Option kann der Dienst unterbrochen werden.
- 04Ein passendes Modell herunterladenWählen Sie aus der Tabelle ein Modell mit dem Hinweis «ja» für Ihre Speichergröße, beispielsweise qwen3.5:9b auf 16 GB.
- 05Von einem anderen Gerät prüfenSenden Sie eine Anfrage an die Adresse des Mac mini (.local-Name oder IP-Adresse) und führen Sie dann ollama ps aus: Die Spalte Processor muss 100 % GPU anzeigen.
Zwei häufig übernommene Einstellungen sind hier unnötig: Laut der Dokumentation von Ollama wird Flash Attention automatisch aktiviert, wenn die Hardware dies unterstützt, und OLLAMA_ORIGINS betrifft Browser-Erweiterungen. Dagegen halbiert die Quantisierung des KV-Caches (OLLAMA_KV_CACHE_TYPE=q8_0) dessen Größe ungefähr bei sehr geringem Qualitätsverlust, was bei 16 GB wichtig ist, wenn der Kontext länger wird.
#LM Studio: die Alternative zu Ollama
LM Studio erfordert einen Apple-Silicon-Chip und macOS 14 oder neuer; 16 GB RAM werden empfohlen. Seit Version 0.3.4 lädt es sowohl GGUF- als auch MLX-Modelle. Ohne Bildschirm lässt sich sein Daemon llmster mit lms daemon up starten. Die Option „Serve on Local Network“ macht die API im Netzwerk zugänglich; die Token-Authentifizierung ist standardmäßig nicht aktiviert. Die MLX-Engine von Ollama, die im März 2026 als Vorabversion vorgestellt wurde, erforderte mehr als 32 GB: Ein M4 mit 16 GB konnte davon nicht profitieren.
#Was ein Mac mini leisten kann: Chat, RAG, Agenten, Cluster
- Privater Chatserver
- Die APIs von Ollama und LM Studio unterstützen Clients im OpenAI-Format (Open WebUI, Zed, Skripte). In der Nähe des Routers aufgestellt, versorgt der Mac mini das ganze Haus.
- Dokumentbasiertes RAG
- Das Generierungsmodell und ein Embedding-Modell müssen geladen werden. nomic-embed-text ist 274 MB groß: Bei 16 GB passt es zusammen mit Qwen 3.5 9B in den Speicher.
- Code-Agent
- Ein Agent sendet bei jedem Schritt lange Prompts: Die Verarbeitung des Prompts zählt mehr als die Generierung, und hier haben M6 und M5 Pro den größten Vorteil.
#Wie viele Benutzer gleichzeitig?
Ollama verarbeitet standardmäßig pro Modell jeweils eine Anfrage gleichzeitig (OLLAMA_NUM_PARALLEL hat den Wert 1). Jede parallele Anfrage vergrößert den zugewiesenen Kontext: Laut Dokumentation werden für 4 Anfragen mit einem Kontext von jeweils 2.000 Tokens insgesamt 8.000 Tokens zugewiesen. Cache-Speicherbedarf = Cache einer Unterhaltung × parallele Anfragen. Jeder erhält seine Antwort langsamer; hier liegen keine zuverlässigen Messungen für eine bestimmte Personenzahl vor.
#Mehrere Mac mini zu einem Cluster verbinden
Nur der M4 Pro bietet Thunderbolt 5 (120 Gb/s); der M4 ist auf Thunderbolt 4 (40 Gb/s) beschränkt. Das Projekt exo unterstützt RDMA über Thunderbolt 5, das die Latenz zwischen Rechnern angeblich um 99 % reduzieren soll. Das Projekt gibt außerdem an, dass die Modelle unter macOS 26.2 oder neuer mit jedem zusätzlichen Gerät schneller laufen. Seine Benchmarks beziehen sich auf Mac Studio, nicht auf Mac mini. Ein Cluster dient in erster Linie dazu, ein Modell zu laden, das für einen einzelnen Rechner zu groß ist.
- Ollama im lokalen Netzwerk teilen (Familie, Team)
- Den Ollama-Server absichern: Authentifizierung und Reverse Proxy
- Exo: Mehrere Rechner in einen selbstgebauten LLM-Cluster verwandeln
- Den Mac mit Apple Silicon optimieren: GPU-Speicherlimit, Flash Attention, KV-Cache
- Hardware-Steckbrief: Mac mini M6
- Hardware-Steckbrief: Mac mini M5 Pro
#Mac mini M4 oder MacBook Air M4: gleicher Chip, anderer Einsatzzweck
Das MacBook Air mit 13 Zoll und M4 verwendet denselben Chip, mit derselben Bandbreite (120 GB/s) und denselben Speicheroptionen von 16, 24 oder 32 GB: Die maximale Geschwindigkeit ist identisch. Was sich unterscheidet, ist das Gehäuse. Die frühere Version dieses Leitfadens bezifferte die Verlangsamung des Air nach zehn Minuten auf 20 %; keine Quelle bestätigt diese Angabe, und sie wurde entfernt. Für einen dauerhaft laufenden Dienst ist der Mac mini die naheliegende Wahl; für einen mobilen Arbeitsplatz (1,24 kg einschließlich Display und Akku) das MacBook.
- Quelle: Apple, technisches Datenblatt des Mac mini (2024)
- Quelle: Apple, Ankündigung der Mac mini M6 und M5 Pro (August 2026)
- Quelle: llama.cpp, Leistung auf Chips der Apple-M-Serie
- Quelle: Ollama-Dokumentation, FAQ (Umgebungsvariablen, KV-Cache)
- Quelle: Dokumentation LM Studio, Servermodus ohne Benutzeroberfläche
#Häufig gestellte Fragen
Ist ein Mac mini M4 mit 16 GB ausreichend für einen lokalen LLM?+
Welches LLM ist das beste für einen Mac mini M4 mit 16 GB?+
Mac mini M4 oder M4 Pro für die lokale KI?+
Ist der Mac mini M6 viel schneller als der M4 für ein LLM?+
Kann man mehrere Mac mini in einem Cluster verbinden, um ein LLM zu betreiben?+
Wie viel verbraucht ein Mac mini M4 als LLM-Server rund um die Uhr?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.