Einsteiger 14 Min.Mac mini

Welcher LLM für Mac mini M4 / M4 Pro (16–64 GB)? ?

Direkte Antwort

Auf einem Mac mini M4 lässt sich bereits mit 16 GB ein lokales LLM gut betreiben: Modelle mit 7 bis 12 Milliarden Parametern erreichen bei einem 7B-Modell in Q4_0 bestenfalls etwa zwanzig Tokens/s, da die Speicherbandbreite von 120 GB/s die Geschwindigkeit begrenzt. Für Modelle mit 14 bis 35 Milliarden Parametern benötigen Sie einen M4 Pro (273 GB/s, 24 bis 64 GB). Apple hat diese Baureihe im August 2026 durch die Mac mini M6 und M5 Pro ersetzt.

Dieser Leitfaden nutzt die Zahlen von Apple und llama.cpp sowie aus den Dokumentationen von Ollama und LM Studio als Entscheidungshilfe: welcher Chip, wie viel Speicher, welches Modell und welche Geschwindigkeit zu erwarten ist. Er unterscheidet zwischen Apples Angaben, Messungen der Community und bloßen Berechnungen und gibt einen Überblick über die im September 2026 erschienene Modellreihe mit M6 und M5 Pro.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-29·Getestet auf macOS 14+
Empfohlene Hardware

Kaufalternative für diesen Guide: Mac mini M5 Pro (24 GB / 512 GB).

Warum diese Wahl? Unsere vollständige Übersicht zu Mac mini M5 Pro (24 GB / 512 GB) →

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#Mac mini M4 und lokale LLMs: Was der Rechner kann

Ein Mac mini eignet sich gut als lokaler LLM-Server, weil sein gemeinsamer Speicher von Prozessor und GPU genutzt wird, ohne separaten VRAM. Zwei Kennzahlen bestimmen, was Sie damit machen können. Die Kapazität (16 bis 64 GB je nach Chip) bestimmt die Größe des Modells, das geladen werden kann: 7 bis 12 Milliarden Parameter bei 16 GB, 24 bis 35 Milliarden bei 32 bis 48 GB. Die Bandbreite bestimmt die Geschwindigkeit: laut Apple 120 GB/s beim M4-Chip und 273 GB/s beim M4 Pro. Ein LLM liest seine Gewichte für jedes erzeugte Token erneut ein, sodass der maximale Durchsatz ungefähr der Bandbreite geteilt durch die Größe der Gewichte entspricht. Für ein 7B-Modell in Q4_0 nennt die öffentliche Tabelle von llama.cpp 24,1 Tokens/s für einen M4 und etwa 50 für einen M4 Pro. Apple hat im August 2026 Mac mini mit M6 und M5 Pro vorgestellt, die diese Baureihe ersetzen; der M4 war Ende August noch bei einigen Händlern erhältlich.

Mac mini M4
CPU 10 Kerne, GPU 10 Kerne, 120 GB/s, 16 GB gemeinsamer Speicher (24 oder 32 GB optional), Thunderbolt 4.
Mac mini M4 Pro
CPU 12 Kerne, GPU 16 Kerne (14 und 20 optional), 273 GB/s, 24 GB Speicher (48 oder 64 GB optional), Thunderbolt 5.
Abmessungen und Geräuschentwicklung
12,7 × 12,7 × 5,0 cm, 0,67 kg (M4) oder 0,73 kg (M4 Pro); 5 dBA im Ruhezustand, gemäß Apple.
Angegebener Stromverbrauch
M4: 4 W im Leerlauf, maximal 65 W. M4 Pro: 5 W und 140 W. Apple veröffentlicht keinen Wert für den Inferenzbetrieb.
!
Die M4-Serie ist seit August 2026 abgelöst
Apple hat die Mac mini M6 und M5 Pro im August 2026 vorgestellt; sie sind ab dem 22. September erhältlich. Die folgenden Tabellen gelten für einen M4, den Sie bereits gekauft haben, der noch auf Lager ist oder gebraucht angeboten wird.

#Mac mini M4 oder M4 Pro: Die Bandbreite ist entscheidend

Das Mac-Kit

Sie wissen, welches Modell auf Ihren Mac mini M4 passt. Das Mac-Kit zeigt Ihnen, wie Sie das Maximum herausholen: die GPU-Speichergrenze weiter hinausschieben (Kap. 2), zwischen MLX und GGUF wählen (Kap. 3) und Ihren Mac mini zu einem KI-Server für das ganze Haus machen (Kap. 12).

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Der wesentliche Unterschied zwischen den beiden Chips liegt nicht in der maximalen Speicherkapazität (32 GB gegenüber 64 GB), sondern in der um den Faktor 2,3 höheren Bandbreite (273 ÷ 120). In der Tabelle von llama.cpp beträgt das gemessene Verhältnis bei der Generierung 2,1 (50,7 ÷ 24,1 bei Q4_0) und beim Lesen des Prompts 2,0 (440 ÷ 221).

Mac mini M4 und M4 Pro für ein LLM (Quellen: Apple, llama.cpp)
KriteriumMac mini M4Mac mini M4 Pro
Speicherbandbreite (Apple)120 GB/s273 GB/s
Gemeinsamer Arbeitsspeicher (Apple)16 GB, optional 24 oder 32 GB24 GB, Option 48 oder 64 GB
Generierung, Llama 2 7B in Q4_0 (llama.cpp)24,1 Tokens pro Sekunde50,7 Tokens/s (GPU mit 20 Kernen)
Generierung, gleiches Modell in Q8_013,5 Tokens pro Sekunde30,7 Tokens/s
Verarbeitung des Prompts, Q4_0221 Token/s440 Token/s
Thunderbolt-Ports (Apple)Thunderbolt 4, 40 Gb/sThunderbolt 5, 120 Gb/s
Der M4 reicht aus, wenn
Sie allein arbeiten, Modelle mit bis zu 12 Milliarden Parametern (Qwen 3.5 9B, Gemma 4 12B) anstreben und bestenfalls etwa zwanzig Tokens/s akzeptieren. Wählen Sie 24 GB, um zusätzlich ein Embedding-Modell geladen zu halten.
Der M4 Pro ist die beste Wahl, wenn
Sie möchten Modelle mit 14 bis 27 Milliarden Parametern, ein MoE mit 30 bis 35 Milliarden Parametern (mindestens 48 GB), einen Code-Agenten oder mehrere Benutzer unterstützen. Für mehr als 64 GB ist ein Mac Studio erforderlich.

#VRAM auf dem Mac mini: der vereinheitlichte Speicher und seine GPU-Obergrenze

Ein Mac mini hat keinen separaten VRAM, aber die GPU kann nicht den gesamten Arbeitsspeicher nutzen. Laut Nutzern von llama.cpp liegt die standardmäßige Obergrenze bei zwei Dritteln bis drei Vierteln des RAM; beim Start zeigt llama.cpp die Zeile recommendedMaxWorkingSetSize an, die den tatsächlichen Wert angibt. Die Einstellung iogpu.wired_limit_mb hat standardmäßig den Wert 0. Das bedeutet „Standardrichtlinie des Systems“ und nicht „unbegrenzt“.

Standardmäßige GPU-Speichergrenze, geschätzt auf zwei Drittel und drei Viertel des Arbeitsspeichers
Speicher des Mac miniGeschätztes GPU-SpeicherlimitVerbleibender Speicher für macOS
16 GB10,7 bis 12 GB4 bis 5 GB
24 GB16 bis 18 GB6 bis 8 GB
32 GB21 bis 24 GB8 bis 11 GB
48 GB32 bis 36 GB12 bis 16 GB
64 GB43 bis 48 GB16 bis 21 GB

Das Speicherlimit muss Platz für die Gewichte, den KV-Cache (den Kontextspeicher, der mit der Unterhaltung wächst) und die Rechenpuffer bieten. Um ein Modell zu laden, das knapp an die Grenze stößt, wird das Limit angehoben: MLX empfiehlt einen Wert oberhalb der Modellgröße in Megabyte, aber unterhalb der Speicherkapazität des Rechners. Lassen Sie mehrere Gigabyte für macOS frei, sonst bricht die Geschwindigkeit ein. Eine manuelle sysctl-Einstellung bleibt nach einem Neustart möglicherweise nicht erhalten.

Die Obergrenze auslesen und anschließend erhöhen (Beispiel: M4 Pro mit 48 GB)
# Valeur actuelle : 0 = plafond par défaut du système
sysctl iogpu.wired_limit_mb

# 40 Go pour le GPU sur 48 Go de RAM (40 x 1024 = 40960 Mo)
sudo sysctl iogpu.wired_limit_mb=40960

#Welches Modell für welche Speicherkapazität: Was in den Speicher eines Mac mini passt

Die Tabelle vergleicht die Größe der von Ollama veröffentlichten Dateien mit einer Obergrenze von zwei Dritteln des Arbeitsspeichers (vorsichtige Annahme). „Ja“: Die Modellgewichte belegen weniger als 70 % dieser Obergrenze, sodass Platz für den KV-Cache bleibt. „Knapp“: Sie passen hinein, sofern der Kontext kurz ist. „Nein“: Sie überschreiten die Obergrenze. Das sind Berechnungen, keine Messungen.

Standardquantisierung von Ollama, es sei denn, es wird anders angegeben: Passt das Modell in die Standard-GPU-Grenze?
ModellModellgröße (Ollama)M4 16 GBM4 24 GBM4 32 GBM4 Pro 48 GBM4 Pro 64 GB
Qwen 3.5 9B6,6 GBjajajajaja
Gemma 4 12B7,6 GBgenaujajajaja
gpt-oss 20B14 GBneingenaujajaja
Mistral Small 24B14 GBneingenaujajaja
Qwen 3.8 27B18 GBneinneingenaujaja
Qwen3-Coder 30B-A3B19 GBneinneingenaujaja
Qwen 3.6 35B-A3B (MoE)23 GBneinneinneingenauja
Qwen3-Coder 30B-A3B in Q8_032 GBneinneinneingenaugenau

#Mac mini M4 mit 16 GB: empfehlenswerte Modelle

Bei 16 GB liegt die Obergrenze bei etwa 11 GB. Qwen 3.5 9B (6,6 GB bei Ollama) lässt etwa 4 GB für den KV-Cache und die Puffer übrig. Gemma 4 12B (7,6 GB) passt mit einem kurzen Kontext. Ein 14 GB großes Modell wie Mistral Small 24B überschreitet diese Grenze: Ollama verteilt es auf GPU und CPU, und die Geschwindigkeit sinkt. Der Befehl ollama ps zeigt die Verteilung an; streben Sie 100 % GPU an.

→
Ein MoE verringert die Zeit pro Token, nicht den Speicherbedarf
Qwen3-Coder 30B-A3B hat insgesamt 30,5 Milliarden Parameter, aber nur 3,3 Milliarden aktive Parameter pro Token: Das Modell liest nur wenige Gewichte und arbeitet schnell, aber die gesamte Datei (19 GB) bleibt im Speicher. Es passt daher trotz seiner 3 Milliarden aktiven Parameter nicht in den Speicher eines Mac mini mit 16 GB.

#Geschwindigkeit eines Mac mini: theoretischer Höchstwert und veröffentlichte Messwerte

Der Generierungsdurchsatz wird durch die Bandbreite begrenzt: Tokens pro Sekunde ≈ Bandbreite (GB/s) ÷ bei jedem Token gelesene Modellgewichte (GB). Diese Berechnung liefert eine Obergrenze, niemals einen Messwert. Für ein dichtes Modell mit 14 GB ergeben 120 ÷ 14 auf einem M4 bestenfalls 8,6 Tokens/s und 273 ÷ 14 auf einem M4 Pro 19,5 Tokens/s.

Theoretische Obergrenze in Tokens/s (Bandbreite ÷ Modellgröße in Ollama, dichte Modelle)
ModellModellgrößeM4 (120 GB/s)M4 Pro (273 GB/s)
Qwen 3.5 9B6,6 GB1841
Gemma 4 12B7,6 GB1636
Mistral Small 24B14 GB8,619,5

Die veröffentlichten Messwerte bleiben unter dieser Obergrenze. Hier folgen die Messwerte mit Llama 2 7B aus der Tabelle, die die llama.cpp-Community für Apple-Chips aktuell hält. Es sind nicht unsere Messungen, und sie beziehen sich auf ein älteres Modell in Q4_0 und Q8_0, zeigen aber das Verhältnis zwischen den Chips.

llama.cpp, Llama 2 7B: tokens/s (GitHub-Diskussion 4167, Commit 8e672ef)
ChipBandbreiteGenerierung Q4_0Generierung Q8_0Prompt Q4_0
M4 (GPU mit 10 Kernen)120 GB/s24,113,5221
M4 Pro (GPU mit 16 Kernen)273 GB/s49,630,5364
M4 Pro (GPU mit 20 Kernen)273 GB/s50,730,7440
M5 Pro (GPU mit 20 Kernen)307 GB/s66,338,91 621

Der Wechsel von Q8_0 zu Q4_0 beschleunigt die Generierung auf dem M4 um den Faktor 1,8 und auf dem M4 Pro um den Faktor 1,7: Die Dateigröße zählt mehr als der Rechenaufwand. Die GPU-Kerne beeinflussen vor allem das Einlesen des Prompts (364 gegenüber 440 Tokens/s auf dem M4 Pro). Zum Zeitpunkt der Einsichtnahme enthält die Tabelle keine M6-Messwerte.

i
Ein Reasoning-Modell braucht Zeit zum Antworten
Ein Modell mit Reasoning erzeugt oft 2 000 Tokens vor seiner eigentlichen Antwort. Bei 8 Tokens/s (ein dichtes 14B-Modell auf einem M4) sind das 250 Sekunden, also mehr als 4 Minuten. Bei 19 Tokens/s auf einem M4 Pro sind es etwa 105 Sekunden. Diese Berechnung fällt bei der Wahl zwischen M4 und M4 Pro ins Gewicht.

#Mac mini M6 und M5 Pro: Was die neue Serie für ein LLM verändert

Apple gibt für den Mac mini M6 eine bis zu 4,8-mal so hohe Geschwindigkeit bei der Promptverarbeitung in LM Studio wie beim M4 an und für den M5 Pro eine bis zu 4-mal so hohe wie beim M4 Pro. Diese Zuwächse betreffen das Einlesen des Prompts, das von den neuronalen Beschleunigern profitiert, die jedem GPU-Kern hinzugefügt wurden. Die Generierung wird weiterhin durch die Bandbreite bestimmt und legt deutlich weniger zu: zwischen 12 % (307 gegenüber 273 GB/s) und 42 % (170 gegenüber 120 GB/s).

Die vier Chips (Quelle: Apple)
ChipBandbreiteUnified MemoryLeerlauf / Maximum
M4120 GB/s16, 24 oder 32 GB4 W / 65 W
M6153 GB/s (16 GB), 170 GB/s (24 GB und mehr)16, 24 oder 32 GB4 W / 70 W
M4 Pro273 GB/s24, 48 oder 64 GB5 W / 140 W
M5 Pro307 GB/s24, 48 oder 64 GB6 W / 145 W

Ein M6 in der Basisversion mit 153 GB/s hat nur 28 % mehr Bandbreite als der M4: Die theoretische Obergrenze für ein 9B-Modell steigt von 18 auf etwa 23 Tokens/s. Die neue Modellreihe kommt vor allem Anwendungen mit langem Kontext zugute: einem RAG-System, das lange Dokumente in den Kontext einfügt, oder einem Code-Agenten, der ein Repository erneut liest.

Neugerät, Modell mit 30 bis 35 Milliarden Parametern
Ein M5 Pro mit mindestens 48 GB, 64 GB für komfortables Arbeiten mit einem MoE von 35 Milliarden: Der M6 hat ein Limit von 32 GB.
M4 noch verfügbar
Sinnvoll für Modelle mit 7 bis 12 Milliarden Parametern, wenn der Preisunterschied zum M6 deutlich ist. Der Vorrat ist begrenzt.

#Einen LLM-Server auf einem Mac mini mit Ollama installieren

Ollama auf macOS funktioniert wie eine Anwendung, deren Einstellungen über durch launchctl definierte Umgebungsvariablen erfolgen. Standardmäßig hört Ollama nur auf 127.0.0.1, Port 11434: Ohne Änderung kann kein anderes Gerät es nutzen.

  1. 01
    Die Ollama-Anwendung installieren
    Laden Sie Ollama von ollama.com herunter und legen Sie die Anwendung im Ordner Applications ab. Beim ersten Start bietet sie an, eine Verknüpfung für den Befehl ollama zu erstellen.
  2. 02
    Den Port für das lokale Netzwerk öffnen
    Setzen Sie OLLAMA_HOST mit launchctl (Befehl unten) und starten Sie anschließend die Anwendung neu. Die Adresse 0.0.0.0 öffnet die API für das gesamte Netzwerk ohne Authentifizierung: Verwenden Sie sie nur in einem vertrauenswürdigen Netzwerk.
  3. 03
    Ruhezustand verhindern
    Aktivieren Sie in den Systemeinstellungen im Bereich „Energie“ die Option, die den automatischen Ruhezustand bei ausgeschaltetem Bildschirm verhindert: Ohne diese Option kann der Dienst unterbrochen werden.
  4. 04
    Ein passendes Modell herunterladen
    Wählen Sie aus der Tabelle ein Modell mit dem Hinweis «ja» für Ihre Speichergröße, beispielsweise qwen3.5:9b auf 16 GB.
  5. 05
    Von einem anderen Gerät prüfen
    Senden Sie eine Anfrage an die Adresse des Mac mini (.local-Name oder IP-Adresse) und führen Sie dann ollama ps aus: Die Spalte Processor muss 100 % GPU anzeigen.
Ollama-Server auf dem Mac mini
# Écoute sur tout le réseau local, puis relancer l'application Ollama
launchctl setenv OLLAMA_HOST "0.0.0.0:11434"

# Modèle pour 16 Go de mémoire
ollama pull qwen3.5:9b

# Test depuis un autre appareil (remplacez l'adresse)
curl http://mac-mini.local:11434/api/chat -d '{"model": "qwen3.5:9b", "messages": [{"role": "user", "content": "Bonjour"}], "stream": false}'

Zwei häufig übernommene Einstellungen sind hier unnötig: Laut der Dokumentation von Ollama wird Flash Attention automatisch aktiviert, wenn die Hardware dies unterstützt, und OLLAMA_ORIGINS betrifft Browser-Erweiterungen. Dagegen halbiert die Quantisierung des KV-Caches (OLLAMA_KV_CACHE_TYPE=q8_0) dessen Größe ungefähr bei sehr geringem Qualitätsverlust, was bei 16 GB wichtig ist, wenn der Kontext länger wird.

#LM Studio: die Alternative zu Ollama

LM Studio erfordert einen Apple-Silicon-Chip und macOS 14 oder neuer; 16 GB RAM werden empfohlen. Seit Version 0.3.4 lädt es sowohl GGUF- als auch MLX-Modelle. Ohne Bildschirm lässt sich sein Daemon llmster mit lms daemon up starten. Die Option „Serve on Local Network“ macht die API im Netzwerk zugänglich; die Token-Authentifizierung ist standardmäßig nicht aktiviert. Die MLX-Engine von Ollama, die im März 2026 als Vorabversion vorgestellt wurde, erforderte mehr als 32 GB: Ein M4 mit 16 GB konnte davon nicht profitieren.

#Was ein Mac mini leisten kann: Chat, RAG, Agenten, Cluster

Privater Chatserver
Die APIs von Ollama und LM Studio unterstützen Clients im OpenAI-Format (Open WebUI, Zed, Skripte). In der Nähe des Routers aufgestellt, versorgt der Mac mini das ganze Haus.
Dokumentbasiertes RAG
Das Generierungsmodell und ein Embedding-Modell müssen geladen werden. nomic-embed-text ist 274 MB groß: Bei 16 GB passt es zusammen mit Qwen 3.5 9B in den Speicher.
Code-Agent
Ein Agent sendet bei jedem Schritt lange Prompts: Die Verarbeitung des Prompts zählt mehr als die Generierung, und hier haben M6 und M5 Pro den größten Vorteil.

#Wie viele Benutzer gleichzeitig?

Ollama verarbeitet standardmäßig pro Modell jeweils eine Anfrage gleichzeitig (OLLAMA_NUM_PARALLEL hat den Wert 1). Jede parallele Anfrage vergrößert den zugewiesenen Kontext: Laut Dokumentation werden für 4 Anfragen mit einem Kontext von jeweils 2.000 Tokens insgesamt 8.000 Tokens zugewiesen. Cache-Speicherbedarf = Cache einer Unterhaltung × parallele Anfragen. Jeder erhält seine Antwort langsamer; hier liegen keine zuverlässigen Messungen für eine bestimmte Personenzahl vor.

#Mehrere Mac mini zu einem Cluster verbinden

Nur der M4 Pro bietet Thunderbolt 5 (120 Gb/s); der M4 ist auf Thunderbolt 4 (40 Gb/s) beschränkt. Das Projekt exo unterstützt RDMA über Thunderbolt 5, das die Latenz zwischen Rechnern angeblich um 99 % reduzieren soll. Das Projekt gibt außerdem an, dass die Modelle unter macOS 26.2 oder neuer mit jedem zusätzlichen Gerät schneller laufen. Seine Benchmarks beziehen sich auf Mac Studio, nicht auf Mac mini. Ein Cluster dient in erster Linie dazu, ein Modell zu laden, das für einen einzelnen Rechner zu groß ist.

#Mac mini M4 oder MacBook Air M4: gleicher Chip, anderer Einsatzzweck

Das MacBook Air mit 13 Zoll und M4 verwendet denselben Chip, mit derselben Bandbreite (120 GB/s) und denselben Speicheroptionen von 16, 24 oder 32 GB: Die maximale Geschwindigkeit ist identisch. Was sich unterscheidet, ist das Gehäuse. Die frühere Version dieses Leitfadens bezifferte die Verlangsamung des Air nach zehn Minuten auf 20 %; keine Quelle bestätigt diese Angabe, und sie wurde entfernt. Für einen dauerhaft laufenden Dienst ist der Mac mini die naheliegende Wahl; für einen mobilen Arbeitsplatz (1,24 kg einschließlich Display und Akku) das MacBook.

#Häufig gestellte Fragen

Ist ein Mac mini M4 mit 16 GB ausreichend für einen lokalen LLM?+
Ja, für Modelle mit 7 bis 12 Milliarden Parametern. Qwen 3.5 9B (6,6 GB) passt mit einem angemessenen Kontext in das GPU-Speicherlimit von etwa 11 GB. Rechnen Sie bestenfalls mit etwa zwanzig Tokens/s: Der M4 erreicht maximal 120 GB/s. Wählen Sie bei mehr als 12 Milliarden Parametern 24 GB oder einen M4 Pro.
Welches LLM ist das beste für einen Mac mini M4 mit 16 GB?+
Qwen 3.5 9B ist die verlässlichste Wahl: Mit 6,6 GB bei Ollama lässt es Platz für den KV-Cache. Gemma 4 12B (7,6 GB) passt mit einem kurzen Kontext in den Speicher. Vermeiden Sie Modelle ab 14 GB: Sie werden teilweise auf die CPU ausgelagert und verlieren dadurch an Geschwindigkeit.
Mac mini M4 oder M4 Pro für die lokale KI?+
Der M4 Pro, wenn Sie Modelle mit mehr als 12 Milliarden Parametern nutzen möchten: Seine 273 GB/s gegenüber 120 GB/s verdoppeln den Durchsatz ungefähr, und die Speichervarianten mit 48 und 64 GB ermöglichen den Einsatz von MoE-Modellen mit 30 bis 35 Milliarden Parametern. Für ein 9B-Modell bei Nutzung durch eine einzelne Person reicht der M4 aus.
Ist der Mac mini M6 viel schneller als der M4 für ein LLM?+
Für die Verarbeitung des Prompts ja: Apple gibt in LM Studio eine bis zu 4,8-fache Geschwindigkeit an. Für die Generierung nein: Beim M6 in der Basisversion steigt die Bandbreite von 120 auf 153 GB/s, also um etwa 28 %. Bei kurzen Antworten ist der Unterschied gering, bei langen Kontexten groß.
Kann man mehrere Mac mini in einem Cluster verbinden, um ein LLM zu betreiben?+
Ja, mit einem Tool wie exo, insbesondere um ein Modell zu laden, das für einen einzelnen Rechner zu groß ist. Der M4 Pro bietet Thunderbolt 5 (120 Gb/s), der M4 nur Thunderbolt 4 (40 Gb/s). Die von exo veröffentlichten Leistungsgewinne beziehen sich auf Mac-Studio-Rechner: Prüfen Sie diese auf Ihrer eigenen Konfiguration.
Wie viel verbraucht ein Mac mini M4 als LLM-Server rund um die Uhr?+
Apple gibt für den M4 4 W im Ruhezustand und maximal 65 W an (5 W und 140 W für den M4 Pro). Bei dauerhaftem Ruhezustand ergeben 4 W × 8.760 Stunden etwa 35 kWh pro Jahr; multiplizieren Sie diesen Wert mit Ihrem Preis pro kWh. Für die Inferenz veröffentlicht Apple keine Verbrauchsangabe: Ein Steckdosenmessgerät liefert den tatsächlichen Wert.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.