Qwen3 32B auf Mac M1/M2: Speicher und Einstellungen MLX
Qwen3 32B benötigt in der offiziellen MLX-4-Bit-Version 18,4 GB RAM, zuzüglich des Speichers für den genutzten Kontext: Planen Sie mindestens 24 bis 32 GB gemeinsamen Speicher für eine komfortable Nutzung ohne Swap ein. Ein Mac mit einem Basis-M1 oder -M2 (8 oder 16 GB) reicht nicht aus; erforderlich ist ein Pro-, Max- oder Ultra-Chip.
Qwen3 32B ist ein dichtes Modell mit 32,8 Milliarden Parametern und einem nativen Kontext von 32.768 Tokens, der sich über YaRN auf 131.072 Tokens erweitern lässt. Auf einem Mac lautet die Frage nicht nur „Lässt es sich laden?“, sondern auch „Mit wie viel tatsächlich freiem Speicher, welcher Quantisierung und welchem Kontext?“. Dieser Leitfaden erläutert die überprüfbaren Zahlen für einen Mac mit M1 oder M2, ohne eine Kompatibilität vorauszusetzen, die bei den kleinsten Konfigurationen nicht gegeben ist.
#Tatsächlich benötigter vereinheitlichter Arbeitsspeicher
Ausgangspunkt ist die Größe des quantisierten Modells, nicht die Anzahl der Parameter. Die von mlx-community veröffentlichte MLX-Version mit 4-Bit-Quantisierung belegt auf dem Datenträger und beim Laden im Speicher 18,4 GB. Auf einem Mac teilen sich das System, die geöffneten Anwendungen und das Modell den vereinheitlichten Speicher: Nur 18,4 GB RAM insgesamt einzuplanen, lässt keinen Spielraum für das System oder den Gesprächskontext.
Das offizielle Qwen-Modellprofil erläutert die Architektur hinter dieser Modellgröße: 64 Schichten und Grouped-Query Attention (GQA) mit 64 Köpfen für die Abfragen, aber nur 8 Köpfen für Schlüssel und Werte. Konkret bedeuten weniger KV-Köpfe einen kompakteren KV-Cache pro Kontexttoken als bei klassischer Multi-Head Attention mit gleicher Anzahl an Abfrage-, Schlüssel- und Wertköpfen – das ist einer der Gründe, warum ein dichtes Modell mit 32,8 Milliarden Parametern auf einem Mac mit vereinheitlichtem Speicher weiterhin praktikabel ist, sofern die Modellgewichte selbst bereits in den verfügbaren Arbeitsspeicher passen.
| Konfiguration | Realisierbarkeit | Hinweis |
|---|---|---|
| 16 GB vereinheitlichter Arbeitsspeicher | Nicht realistisch | Allein das Modell (18,4 GB bei 4-Bit-Quantisierung) übersteigt bereits die gesamte RAM-Kapazität. |
| 24 GB gemeinsamer Arbeitsspeicher | Möglich, kurzer Kontext | Wenig Spielraum für das System und den KV-Cache; nur für gelegentliche Nutzung geeignet. |
| 32 GB gemeinsamer Arbeitsspeicher | Komfortabel | Ausreichender Spielraum für eine mittlere Kontextlänge ohne häufiges Swapping. |
| 64 GB oder mehr | Gut geeignet | Ermöglicht einen langen Kontext und lässt genug Spielraum, um andere Anwendungen geöffnet zu lassen. |
#Welcher M1/M2-Chip für 32B?
Lokale KI auf Ihrem Mac voll ausschöpfen: Unified Memory, MLX vs. GGUF, das passende Modell für Ihren Chip und auf Apple Silicon abgestimmte Einstellungen für Ollama und LM Studio.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
Ein MacBook Air oder Pro mit einem M1- oder M2-Chip in der Basisversion wird mit 8 oder 16 GB gemeinsamem Speicher verkauft: Das reicht für Qwen3 32B selbst bei 4-Bit-Quantisierung nicht aus. Sie sollten einen M1 Pro/Max/Ultra oder M2 Pro/Max/Ultra mit mindestens 32 GB gemeinsamem Speicher anstreben, damit nach Berücksichtigung des Systems und des Kontexts ein angemessener Spielraum bleibt. Es geht nicht um die Rechenleistung der GPU, sondern um die Menge des physisch im Rechner vorhandenen Speichers, die sich nach dem Kauf nicht erhöhen lässt.
#MLX oder llama.cpp/Ollama?
MLX ist das Framework, das entwickelt wurde, um die vereinheitlichte Speicherarchitektur von Apple Silicon zu nutzen; llama.cpp (und Ollama, das darauf aufbaut) bleibt eine solide Alternative mit einem breiteren Ökosystem an GGUF-Quantisierungen und einem einfacheren Einstieg für alle, die Ollama bereits von anderen Rechnern kennen. Gerade bei Qwen3 32B ist die offizielle MLX-Version mit 4 Bit aus der Community mlx-community hinsichtlich ihrer Größe (18,4 GB) direkt mit den entsprechenden GGUF-Quantisierungen vergleichbar: Die Wahl hängt vor allem davon ab, welches Tool Sie bereits beherrschen, und nicht von Unterschieden in der Machbarkeit.
- MLX wählen
- Wenn Sie bereits im Python/Hugging-Face-Ökosystem arbeiten und eine Konvertierung wünschen, die der Apple-Silicon-Architektur möglichst nahekommt.
- Ollama/llama.cpp wählen
- Wenn Sie einen einzigen Befehl, einen lokalen Standardserver und Kompatibilität mit denselben Tools wie auf PC/Linux wünschen.
#Mit MLX installieren, Schritt für Schritt
- 01Den verfügbaren Speicher prüfenIn der Aktivitätsanzeige (Tab „Speicher“) den tatsächlich freien Speicher notieren, bevor irgendetwas gestartet wird, nicht nur den für den Rechner angegebenen gesamten Arbeitsspeicher.
- 02mlx-lm installierenDas Python-Paket mlx-lm in einer eigenen Umgebung statt global installieren, um Versionskonflikte zu vermeiden.
- 03Die 4-Bit-Version herunterladenmlx-community/Qwen3-32B-4bit statt einer nicht quantisierten Version herunterladen, um den Speicherbedarf beim Laden zu begrenzen.
- 04Zunächst mit einem reduzierten Kontext startenMit einem kurzen Kontext (4.000 bis 8.000 Tokens) beginnen, um zu prüfen, ob das Modell geladen wird und antwortet, bevor die Kontextlänge je nach beobachtetem verbleibendem Speicher schrittweise erhöht wird.
#Die GPU-Speicher-Einstellung für macOS (nicht offiziell)
Auf Apple Silicon reserviert macOS standardmäßig einen Teil des gemeinsamen Speichers, auf den die GPU nicht zugreifen kann: Metal stellt eine empfohlene Arbeitsgröße von etwa 75 % des gesamten RAM bereit. Mit der Systemeinstellung iogpu.wired_limit_mb lässt sich diese Obergrenze technisch anheben. Diese Einstellung ist jedoch nicht offiziell von Apple dokumentiert: Es handelt sich um eine in der technischen Community bekannte Praxis, die nicht unterstützt wird und sich bei einem künftigen macOS-Update ändern oder nicht mehr funktionieren könnte.
Der Wert wird in Megabyte angegeben und muss unter der Kapazität des physischen Speichers bleiben: Rechnen Sie mit dem gesamten RAM abzüglich 6 bis 8 GB für macOS. Das obige Beispiel ist für einen Mac mit 32 GB gedacht (26.624 MB, also 26 GB für die GPU); bei einem Mac mit 64 GB lassen 57.344 MB dieselbe Reserve. Die kursierenden Hinweise mit 122.880 MB beziehen sich auf einen Rechner mit 128 GB: Unverändert auf einen M1 oder M2 mit 32 GB übertragen, würde dieser Wert den installierten Speicher überschreiten.
#Reflexionsmodus: ein indirekter Speicherbedarf
Qwen3-32B bietet einen Mechanismus zum Umschalten zwischen einem Denkmodus, der vor der endgültigen Antwort einen internen Gedankengang erzeugt, und einem direkten Modus. Die Auswahl erfolgt je nach verwendetem Werkzeug über den Parameter enable_thinking oder die Tags /think und /no_think. Auf einem Rechner, dessen Speicher nahezu ausgelastet ist, hat der Denkmodus einen indirekten, aber tatsächlichen Effekt: Jedes vor der endgültigen Antwort erzeugte Denktoken wird dem Kontext des laufenden Gesprächs hinzugefügt und damit auch dem KV-Cache, der mit dem Gespräch wächst. Auf einem Mac mit 24–32 GB begrenzt das Deaktivieren des Denkmodus für einfache Fragen das Wachstum des Kontexts und verringert das Risiko, dass der Speicher bei längeren Sitzungen vollständig ausgelastet wird.
#Swap-Fehler und Anzeichen einer Überlastung
Das deutlichste Anzeichen für zu wenig Arbeitsspeicher ist keine ausdrückliche Fehlermeldung, sondern eine drastische Verlangsamung: Das gesamte System wird langsam, nicht nur das Modell, weil macOS beginnt, Daten in den Swap-Speicher auf der SSD zu schreiben. In der Aktivitätsanzeige ist ein Wechsel der Speicherdruckanzeige zu Orange oder Rot während des Ladens des Modells das Warnsignal, auf das Sie achten sollten, noch bevor Sie auf die erste Antwort warten.
- Speicherdruck beim Laden orange/rot
- Den angeforderten Kontext verkleinern oder, falls verfügbar, zu einer weniger speicherintensiven Quantisierung wechseln.
- Das Modell wird geladen, aber die erste Antwort dauert mehrere Minuten
- Anzeichen für aktives Swapping: Vor einem erneuten Start speicherintensive Anwendungen schließen.
- Laden schlägt sofort fehl
- Der gesamte vereinheitlichte Speicher des Rechners reicht für ein Modell dieser Größe wahrscheinlich nicht aus, auch unter Berücksichtigung der Quantisierung.
Auf der Kommandozeile liefern vm_stat (Anzahl der ausgelagerten Speicherseiten, „Pageouts“) oder memory_pressure -Q eine genauere Diagnose als die rein visuelle Anzeige der Aktivitätsanzeige. Damit lässt sich bestätigen, ob eine Verlangsamung tatsächlich auf eine vollständige Auslastung des Speichers zurückzuführen ist und nicht auf einen anderen Engpass (volle Festplatte, thermische Drosselung bei längerer Nutzung). Eine steigende Anzahl von Pageouts während der Textgenerierung des Modells ist der zuverlässigste Hinweis darauf, dass der gemeinsame Speicher für die aktuelle Konfiguration einschließlich des Kontexts nicht ausreicht.
#Langer Kontext: der tatsächliche Speicherbedarf
Der native Kontext von Qwen3-32B mit 32.768 Tokens, der sich über YaRN auf 131.072 erweitern lässt, benötigt zusätzlichen Speicher: Jeder tatsächlich genutzte Kontexttoken fließt in einen Cache (KV-Cache), der mit dem Gespräch wächst. Auf einem Rechner an der Speichergrenze (24 bis 32 GB) einen moderaten Kontext (8.000 bis 16.000 Tokens) bevorzugen, um einen Sicherheitsspielraum zu lassen; die Erweiterung auf 131.072 Tokens Rechnern mit mindestens 64 GB gemeinsamem Speicher vorbehalten, auf denen nach dem Laden des Modells noch ausreichend Spielraum bleibt.
#Empfohlene Einstellungen je nach Modus
Die Wahl der Sampling-Parameter hat auf einer Maschine mit begrenztem Speicher Auswirkungen: Eine schlecht abgestimmte Einstellung kann Antworten unnötig verlängern und damit auch den Kontext und den KV-Cache vergrößern. Qwen veröffentlicht je nach aktivem Modus unterschiedliche Einstellungen. Übergeben Sie diese ausdrücklich in Ihrem MLX-Client oder in den Generierungsparametern von Ollama, statt die generischen Standardwerte eines anderen Modells beizubehalten.
| Parameter | Reflexionsmodus (enable_thinking=True) | Direkter Modus (enable_thinking=False) |
|---|---|---|
| Temperature | 0,6 | 0,7 |
| Top P | 0,95 | 0,8 |
| Top K | 20 | 20 |
| Min P | 0 | 0 |
Qwen empfiehlt außerdem, für die meisten komplexen Anfragen eine Ausgabelänge von bis zu 32.768 Tokens vorzusehen und presence_penalty zwischen 0 und 2 anzupassen, um Wiederholungen zu begrenzen, falls sie auftreten – wobei ein zu hoher Wert dazu führen kann, dass sich in der Antwort mehrere Sprachen vermischen. Auf einem Mac mit knappem Speicher sollte eine so hohe maximale Ausgabelänge theoretisch bleiben: In der Praxis verhindert das Beenden der Generierung, sobald die Antwort die Frage beantwortet, dass der KV-Cache unnötig wächst.
- MLX vs. llama.cpp auf dem Mac: Vergleich in Zahlen
- Ein Modell entsprechend dem verfügbaren RAM auswählen
- Ein LLM Schritt für Schritt lokal installieren
- KV-Cache quantisieren, um bei langen Kontexten mehr Speicher zu sparen
- Quelle: offizielle Modellkarte von Qwen3-32B (Hugging Face)
- Quelle: offizielle MLX 4-Bit-Version von mlx-community
- Quelle: Einstellung iogpu.wired_limit_mb (nicht offiziell von Apple)
Kann ein Mac M1 mit 8 GB RAM Qwen3 32B ausführen?+
Sollte man für Qwen3 32B auf dem Mac MLX oder Ollama wählen?+
Ist die Einstellung iogpu.wired_limit_mb sicher?+
Welchen Kontext sollte ich auf einer Maschine mit 32 GB verwenden?+
Welche Generierungseinstellungen für Qwen3-32B verwenden?+
Warum verbraucht der Reflexionsmodus mehr Speicher?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.