Mittelstufe 12 Min.Qwen

Qwen3 32B auf Mac M1/M2: Speicher und Einstellungen MLX

Direkte Antwort

Qwen3 32B benötigt in der offiziellen MLX-4-Bit-Version 18,4 GB RAM, zuzüglich des Speichers für den genutzten Kontext: Planen Sie mindestens 24 bis 32 GB gemeinsamen Speicher für eine komfortable Nutzung ohne Swap ein. Ein Mac mit einem Basis-M1 oder -M2 (8 oder 16 GB) reicht nicht aus; erforderlich ist ein Pro-, Max- oder Ultra-Chip.

Qwen3 32B ist ein dichtes Modell mit 32,8 Milliarden Parametern und einem nativen Kontext von 32.768 Tokens, der sich über YaRN auf 131.072 Tokens erweitern lässt. Auf einem Mac lautet die Frage nicht nur „Lässt es sich laden?“, sondern auch „Mit wie viel tatsächlich freiem Speicher, welcher Quantisierung und welchem Kontext?“. Dieser Leitfaden erläutert die überprüfbaren Zahlen für einen Mac mit M1 oder M2, ohne eine Kompatibilität vorauszusetzen, die bei den kleinsten Konfigurationen nicht gegeben ist.

Von Mohamed Meguedmi·Aktualisierung 2026-09-28·Unter Windows, macOS und Linux getestet

#Tatsächlich benötigter vereinheitlichter Arbeitsspeicher

Ausgangspunkt ist die Größe des quantisierten Modells, nicht die Anzahl der Parameter. Die von mlx-community veröffentlichte MLX-Version mit 4-Bit-Quantisierung belegt auf dem Datenträger und beim Laden im Speicher 18,4 GB. Auf einem Mac teilen sich das System, die geöffneten Anwendungen und das Modell den vereinheitlichten Speicher: Nur 18,4 GB RAM insgesamt einzuplanen, lässt keinen Spielraum für das System oder den Gesprächskontext.

Das offizielle Qwen-Modellprofil erläutert die Architektur hinter dieser Modellgröße: 64 Schichten und Grouped-Query Attention (GQA) mit 64 Köpfen für die Abfragen, aber nur 8 Köpfen für Schlüssel und Werte. Konkret bedeuten weniger KV-Köpfe einen kompakteren KV-Cache pro Kontexttoken als bei klassischer Multi-Head Attention mit gleicher Anzahl an Abfrage-, Schlüssel- und Wertköpfen – das ist einer der Gründe, warum ein dichtes Modell mit 32,8 Milliarden Parametern auf einem Mac mit vereinheitlichtem Speicher weiterhin praktikabel ist, sofern die Modellgewichte selbst bereits in den verfügbaren Arbeitsspeicher passen.

Einzuplanender gemeinsamer Speicher für Qwen3 32B
KonfigurationRealisierbarkeitHinweis
16 GB vereinheitlichter ArbeitsspeicherNicht realistischAllein das Modell (18,4 GB bei 4-Bit-Quantisierung) übersteigt bereits die gesamte RAM-Kapazität.
24 GB gemeinsamer ArbeitsspeicherMöglich, kurzer KontextWenig Spielraum für das System und den KV-Cache; nur für gelegentliche Nutzung geeignet.
32 GB gemeinsamer ArbeitsspeicherKomfortabelAusreichender Spielraum für eine mittlere Kontextlänge ohne häufiges Swapping.
64 GB oder mehrGut geeignetErmöglicht einen langen Kontext und lässt genug Spielraum, um andere Anwendungen geöffnet zu lassen.

#Welcher M1/M2-Chip für 32B?

Das Mac-Kit

Lokale KI auf Ihrem Mac voll ausschöpfen: Unified Memory, MLX vs. GGUF, das passende Modell für Ihren Chip und auf Apple Silicon abgestimmte Einstellungen für Ollama und LM Studio.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Ein MacBook Air oder Pro mit einem M1- oder M2-Chip in der Basisversion wird mit 8 oder 16 GB gemeinsamem Speicher verkauft: Das reicht für Qwen3 32B selbst bei 4-Bit-Quantisierung nicht aus. Sie sollten einen M1 Pro/Max/Ultra oder M2 Pro/Max/Ultra mit mindestens 32 GB gemeinsamem Speicher anstreben, damit nach Berücksichtigung des Systems und des Kontexts ein angemessener Spielraum bleibt. Es geht nicht um die Rechenleistung der GPU, sondern um die Menge des physisch im Rechner vorhandenen Speichers, die sich nach dem Kauf nicht erhöhen lässt.

!
Einwand: „Mein Rechner zeigt 16 GB an, mit Swap müsste das doch funktionieren“
Technisch kann macOS die SSD als zusätzlichen Speicher (Swap) nutzen, doch die Datenraten einer SSD sind mit denen des gemeinsamen Speichers nicht vergleichbar: Ein Modell, das massiv auf Swap zurückgreift, wird in der Praxis unbrauchbar, mit Antwortzeiten von Minuten statt Sekunden. Für die regelmäßige Nutzung ist das keine praktikable Option.

#MLX oder llama.cpp/Ollama?

MLX ist das Framework, das entwickelt wurde, um die vereinheitlichte Speicherarchitektur von Apple Silicon zu nutzen; llama.cpp (und Ollama, das darauf aufbaut) bleibt eine solide Alternative mit einem breiteren Ökosystem an GGUF-Quantisierungen und einem einfacheren Einstieg für alle, die Ollama bereits von anderen Rechnern kennen. Gerade bei Qwen3 32B ist die offizielle MLX-Version mit 4 Bit aus der Community mlx-community hinsichtlich ihrer Größe (18,4 GB) direkt mit den entsprechenden GGUF-Quantisierungen vergleichbar: Die Wahl hängt vor allem davon ab, welches Tool Sie bereits beherrschen, und nicht von Unterschieden in der Machbarkeit.

MLX wählen
Wenn Sie bereits im Python/Hugging-Face-Ökosystem arbeiten und eine Konvertierung wünschen, die der Apple-Silicon-Architektur möglichst nahekommt.
Ollama/llama.cpp wählen
Wenn Sie einen einzigen Befehl, einen lokalen Standardserver und Kompatibilität mit denselben Tools wie auf PC/Linux wünschen.

#Mit MLX installieren, Schritt für Schritt

  1. 01
    Den verfügbaren Speicher prüfen
    In der Aktivitätsanzeige (Tab „Speicher“) den tatsächlich freien Speicher notieren, bevor irgendetwas gestartet wird, nicht nur den für den Rechner angegebenen gesamten Arbeitsspeicher.
  2. 02
    mlx-lm installieren
    Das Python-Paket mlx-lm in einer eigenen Umgebung statt global installieren, um Versionskonflikte zu vermeiden.
  3. 03
    Die 4-Bit-Version herunterladen
    mlx-community/Qwen3-32B-4bit statt einer nicht quantisierten Version herunterladen, um den Speicherbedarf beim Laden zu begrenzen.
  4. 04
    Zunächst mit einem reduzierten Kontext starten
    Mit einem kurzen Kontext (4.000 bis 8.000 Tokens) beginnen, um zu prüfen, ob das Modell geladen wird und antwortet, bevor die Kontextlänge je nach beobachtetem verbleibendem Speicher schrittweise erhöht wird.

#Die GPU-Speicher-Einstellung für macOS (nicht offiziell)

Auf Apple Silicon reserviert macOS standardmäßig einen Teil des gemeinsamen Speichers, auf den die GPU nicht zugreifen kann: Metal stellt eine empfohlene Arbeitsgröße von etwa 75 % des gesamten RAM bereit. Mit der Systemeinstellung iogpu.wired_limit_mb lässt sich diese Obergrenze technisch anheben. Diese Einstellung ist jedoch nicht offiziell von Apple dokumentiert: Es handelt sich um eine in der technischen Community bekannte Praxis, die nicht unterstützt wird und sich bei einem künftigen macOS-Update ändern oder nicht mehr funktionieren könnte.

Die GPU-Speichergrenze erhöhen (inoffiziell, auf eigenes Risiko)
sudo sysctl iogpu.wired_limit_mb=26624

Der Wert wird in Megabyte angegeben und muss unter der Kapazität des physischen Speichers bleiben: Rechnen Sie mit dem gesamten RAM abzüglich 6 bis 8 GB für macOS. Das obige Beispiel ist für einen Mac mit 32 GB gedacht (26.624 MB, also 26 GB für die GPU); bei einem Mac mit 64 GB lassen 57.344 MB dieselbe Reserve. Die kursierenden Hinweise mit 122.880 MB beziehen sich auf einen Rechner mit 128 GB: Unverändert auf einen M1 oder M2 mit 32 GB übertragen, würde dieser Wert den installierten Speicher überschreiten.

i
Zu berücksichtigen
Diese Einstellung wird nach einem Neustart auf den Standardwert zurückgesetzt, sofern sie nicht manuell dauerhaft gespeichert wurde. Apple garantiert für diese Konfiguration keinerlei Stabilität. Sie sollte Nutzern vorbehalten bleiben, die bereit sind, den Speicherdruck des Systems zu überwachen und die Änderung bei Instabilität rückgängig zu machen.

#Reflexionsmodus: ein indirekter Speicherbedarf

Qwen3-32B bietet einen Mechanismus zum Umschalten zwischen einem Denkmodus, der vor der endgültigen Antwort einen internen Gedankengang erzeugt, und einem direkten Modus. Die Auswahl erfolgt je nach verwendetem Werkzeug über den Parameter enable_thinking oder die Tags /think und /no_think. Auf einem Rechner, dessen Speicher nahezu ausgelastet ist, hat der Denkmodus einen indirekten, aber tatsächlichen Effekt: Jedes vor der endgültigen Antwort erzeugte Denktoken wird dem Kontext des laufenden Gesprächs hinzugefügt und damit auch dem KV-Cache, der mit dem Gespräch wächst. Auf einem Mac mit 24–32 GB begrenzt das Deaktivieren des Denkmodus für einfache Fragen das Wachstum des Kontexts und verringert das Risiko, dass der Speicher bei längeren Sitzungen vollständig ausgelastet wird.

→
Widerspruch: „Der Reflexionsmodus verbessert die Qualität, warum sollte er deaktiviert werden?“
Es geht nicht darum, ihn grundsätzlich zu deaktivieren, sondern ihn dann zu aktivieren, wenn die Aufgabe es rechtfertigt (mehrstufiges Schlussfolgern, Berechnungen, komplexer Code), und bei kurzen Dialogen im direkten Modus zu bleiben. Dort ist der Qualitätsgewinn im Verhältnis zum Token- und Speicheraufwand gering.

#Swap-Fehler und Anzeichen einer Überlastung

Das deutlichste Anzeichen für zu wenig Arbeitsspeicher ist keine ausdrückliche Fehlermeldung, sondern eine drastische Verlangsamung: Das gesamte System wird langsam, nicht nur das Modell, weil macOS beginnt, Daten in den Swap-Speicher auf der SSD zu schreiben. In der Aktivitätsanzeige ist ein Wechsel der Speicherdruckanzeige zu Orange oder Rot während des Ladens des Modells das Warnsignal, auf das Sie achten sollten, noch bevor Sie auf die erste Antwort warten.

Speicherdruck beim Laden orange/rot
Den angeforderten Kontext verkleinern oder, falls verfügbar, zu einer weniger speicherintensiven Quantisierung wechseln.
Das Modell wird geladen, aber die erste Antwort dauert mehrere Minuten
Anzeichen für aktives Swapping: Vor einem erneuten Start speicherintensive Anwendungen schließen.
Laden schlägt sofort fehl
Der gesamte vereinheitlichte Speicher des Rechners reicht für ein Modell dieser Größe wahrscheinlich nicht aus, auch unter Berücksichtigung der Quantisierung.

Auf der Kommandozeile liefern vm_stat (Anzahl der ausgelagerten Speicherseiten, „Pageouts“) oder memory_pressure -Q eine genauere Diagnose als die rein visuelle Anzeige der Aktivitätsanzeige. Damit lässt sich bestätigen, ob eine Verlangsamung tatsächlich auf eine vollständige Auslastung des Speichers zurückzuführen ist und nicht auf einen anderen Engpass (volle Festplatte, thermische Drosselung bei längerer Nutzung). Eine steigende Anzahl von Pageouts während der Textgenerierung des Modells ist der zuverlässigste Hinweis darauf, dass der gemeinsame Speicher für die aktuelle Konfiguration einschließlich des Kontexts nicht ausreicht.

#Langer Kontext: der tatsächliche Speicherbedarf

Der native Kontext von Qwen3-32B mit 32.768 Tokens, der sich über YaRN auf 131.072 erweitern lässt, benötigt zusätzlichen Speicher: Jeder tatsächlich genutzte Kontexttoken fließt in einen Cache (KV-Cache), der mit dem Gespräch wächst. Auf einem Rechner an der Speichergrenze (24 bis 32 GB) einen moderaten Kontext (8.000 bis 16.000 Tokens) bevorzugen, um einen Sicherheitsspielraum zu lassen; die Erweiterung auf 131.072 Tokens Rechnern mit mindestens 64 GB gemeinsamem Speicher vorbehalten, auf denen nach dem Laden des Modells noch ausreichend Spielraum bleibt.

#Empfohlene Einstellungen je nach Modus

Die Wahl der Sampling-Parameter hat auf einer Maschine mit begrenztem Speicher Auswirkungen: Eine schlecht abgestimmte Einstellung kann Antworten unnötig verlängern und damit auch den Kontext und den KV-Cache vergrößern. Qwen veröffentlicht je nach aktivem Modus unterschiedliche Einstellungen. Übergeben Sie diese ausdrücklich in Ihrem MLX-Client oder in den Generierungsparametern von Ollama, statt die generischen Standardwerte eines anderen Modells beizubehalten.

Empfohlene Generierungseinstellungen von Qwen je nach Modus
ParameterReflexionsmodus (enable_thinking=True)Direkter Modus (enable_thinking=False)
Temperature0,60,7
Top P0,950,8
Top K2020
Min P00

Qwen empfiehlt außerdem, für die meisten komplexen Anfragen eine Ausgabelänge von bis zu 32.768 Tokens vorzusehen und presence_penalty zwischen 0 und 2 anzupassen, um Wiederholungen zu begrenzen, falls sie auftreten – wobei ein zu hoher Wert dazu führen kann, dass sich in der Antwort mehrere Sprachen vermischen. Auf einem Mac mit knappem Speicher sollte eine so hohe maximale Ausgabelänge theoretisch bleiben: In der Praxis verhindert das Beenden der Generierung, sobald die Antwort die Frage beantwortet, dass der KV-Cache unnötig wächst.

Häufig gestellte Fragen
Kann ein Mac M1 mit 8 GB RAM Qwen3 32B ausführen?+
Nein. Die 4-Bit-Version des Modells benötigt bereits 18,4 GB und damit mehr als den gesamten Speicher eines Mac mit 8 oder 16 GB, noch bevor das System und der Kontext berücksichtigt werden. Erforderlich ist mindestens eine Konfiguration mit 24–32 GB gemeinsamem Speicher (Unified Memory), idealerweise ein Pro-, Max- oder Ultra-Chip mit 32 GB oder mehr für eine komfortable Nutzung.
Sollte man für Qwen3 32B auf dem Mac MLX oder Ollama wählen?+
Beide funktionieren mit vergleichbaren Dateigrößen (etwa 18–20 GB bei 4-Bit). MLX ist von Grund auf für die einheitliche Speicherarchitektur von Apple Silicon konzipiert; Ollama/llama.cpp erleichtert den Einstieg, wenn Sie es bereits auf anderen Rechnern verwenden. Die Wahl ändert nichts am mindestens benötigten Speicher, sondern nur an den Werkzeugen rund um das Modell.
Ist die Einstellung iogpu.wired_limit_mb sicher?+
Diese Einstellung ist von Apple nicht offiziell dokumentiert: Sie funktioniert in der Praxis und wird von der technischen Community beschrieben, bleibt aber ohne offiziellen Support, kehrt nach einem Neustart zu ihrem Standardwert zurück und kann durch ein künftiges macOS-Update verändert werden. Bei der Verwendung die Speicherdruckanzeige in der Aktivitätsanzeige im Blick behalten und bereit sein, die Änderung rückgängig zu machen.
Welchen Kontext sollte ich auf einer Maschine mit 32 GB verwenden?+
Ein moderater Kontext zwischen 8.000 und 16.000 Tokens lässt nach dem Laden des Modells in 4 Bit (18,4 GB) und unter Berücksichtigung des Systems genügend Speicherreserve. Den über YaRN auf 131.072 Tokens erweiterten Kontext Maschinen mit 64 GB oder mehr vorbehalten, auf denen der KV-Cache genügend Spielraum zum Wachsen hat, ohne den verfügbaren Speicher auszuschöpfen.
Welche Generierungseinstellungen für Qwen3-32B verwenden?+
Qwen empfiehlt temperature=0.6, top_p=0.95, top_k=20 im Reflexionsmodus und temperature=0.7, top_p=0.8, top_k=20 im Direktmodus, mit min_p=0 in beiden Fällen. Diese Werte bringen Qualität und Antwortlänge ins Gleichgewicht; auf einem Mac mit knappem Speicher vermeiden sie außerdem eine unnötig lange Generierung, die den KV-Cache vergrößern würde.
Warum verbraucht der Reflexionsmodus mehr Speicher?+
Der Denkmodus erzeugt vor der endgültigen Antwort einen internen Gedankengang. Jedes Token dieses Gedankengangs wird dem Kontext der laufenden Unterhaltung hinzugefügt und damit auch dem KV-Cache, der mit ihr wächst. Auf einem Mac mit 24–32 GB Speicher begrenzt das Deaktivieren dieses Modus bei einfachen Fragen dieses Wachstum und verringert das Risiko, dass der Speicher bei langen Sitzungen voll wird.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.