Fortgeschritten 13 minQwen

Qwen3.7 Max lokal: das Beste unter den Open-Weights-Modellen selbst hostbar

Qwen3.7 Max ist der größte open-weight-Modell von Alibaba bislang: ein MoE von Frontierschicht, konzipiert, um mit hochwertigen proprietären Modellen zu konkurrieren. Die lokale Ausführung von qwen3.7 max local ist kein Aufwand für den Alltag – dafür benötigt man ernsthafte Hardware und etwas Organisation. Dieser Leitfaden zeigt die tatsächlich auf 24 bis 48 GB pro Karte passierbaren Quantisierungen auf, wie der Modell auf mehrere GPU verteilt werden kann, den erwarteten Durchsatz und die Fälle, in denen er die Cloud-APIs vollständig übertrifft.

Von Mohamed Meguedmi·Aktualisierung 2026-06-03·Unter Windows, macOS und Linux getestet

#Warum Qwen3.7 Max?

In nahezu allen öffentlichen Benchmarks von Ende 2026 belegt Qwen3.7 Max den ersten Platz unter den Open-Weight-Modellen: mehrstufiges Schlussfolgern, Code, Mathematik, Befolgen langer Anweisungen auf Chinesisch und Englisch — und Französischkenntnisse, für die es sich nicht mehr schämen muss. Auf diesem Niveau gibt es keinen technischen Grund mehr, Prompts an einen Cloud-Anbieter zu senden, außer wenn ein enorm hoher Durchsatz benötigt wird.

Das Modell wird unter der Tongyi Qianwen-Lizenz verbreitet (Apache-2.0 für die meisten Gewichte). Die Varianten Instruct, Coder und Thinking werden auf Hugging Face veröffentlicht und auch auf ollama.com/library angeboten. Für alle, die über eine gut ausgestattete KI-Workstation verfügen, ist es derzeit das überzeugendste Open-Weight-Modell gegenüber GPT-5 Mini oder Claude Sonnet 4.

i
An wen richtet sich dieser Guide
Sie haben mindestens eine RTX 4090, einen Mac Studio M5 Ultra oder eine Dual-GPU-Konfiguration mit 3090/4090. Wenn Sie nur eine Karte mit 12–16 GB haben, bleiben Sie bei Qwen3.6 35B-A3B oder Qwen3 32B – Qwen3.7 Max ist nicht für Sie geeignet.

#Der Modellüberblick

Das Kit Lokale KI

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates
Architektur
Mixture-of-Experts. Etwa 480 Milliarden Parameter insgesamt, ~46 Milliarden aktive Parameter pro Token (8 von 128 Experten werden per Routing ausgewählt).
Nativer Kontext
256 k Tokens über YaRN, 1 M Token in der experimentellen Erweiterung. Der Großteil der Anwendungen bleibt unter 32 k.
Tokenizer
Mehrsprachige BPE nach dem Vorbild von Tiktoken, kompaktes Token-Wort-Verhältnis im Französischen (≈ 1,4 Token/Wort – vergleichbar mit GPT-4).
Varianten
Qwen3.7-Max-Instruct (allgemeiner Chat), -Coder (Programmierung), -Thinking (explizites Schlussfolgern wie bei DeepSeek R1).
Lizenz
Apache-2.0 für die Hauptgewichte. Kommerzieller Einsatz erlaubt, Weiterverteilung erlaubt, strenge Wettbewerbsverbote nicht vorhanden.
!
MoE = sämtliche Modellgewichte im Speicher
Auch wenn pro Token nur 46 Milliarden Parameter aktiv sind, müssen alle 480 Milliarden Parameter zugänglich bleiben. Der Router wechselt bei jedem Token die Experten – die inaktiven Experten lassen sich nicht „entladen“, ohne einen katastrophal hohen I/O-Aufwand zu verursachen. Planen Sie Ihren gesamten VRAM-Bedarf entsprechend.

#Hardware-Voraussetzungen

Gesamter VRAM (Q4_K_M)
≈ 270 GB für das Modell + KV-Cache einplanen. Das ist die Zielgröße für Multi-GPU-Konfigurationen oder einen Mac Studio Ultra mit 256 GB.
Minimale praxistaugliche Workstation
Mac Studio M2 Ultra mit 192 GB (Q3_K_M, Kontext 8 k) — das einzige Einzelrechner-Setup für den Verbrauchermarkt, das ohne zwei GPUs auskommt.
Komfortable Workstation
4× RTX 4090 mit je 24 GB (insgesamt 96 GB, Q2_K + Offloading), oder 2× RTX 6000 Ada mit je 48 GB, oder ein Mac Studio M3 Ultra oder M5 Ultra mit 256 GB für das vollständige Modell in Q4_K_M.
System-RAM
Mindestens 128 GB, wenn Sie Experten in den Arbeitsspeicher auslagern möchten. 256 GB empfohlen, wenn Sie das Modell ausschließlich in den Arbeitsspeicher laden (sehr langsam, aber funktionsfähig).
Festplatte
≈ 270 GB für Q4_K_M, ≈ 1 TB für FP16. Eine Gen4-NVMe-SSD ist erforderlich – sonst dauert das anfängliche Laden 20 Minuten oder länger.
Runtime
llama.cpp-Build nach Oktober 2026 (Unterstützung für Tensorparallelität bei MoE-Modellen), vLLM ≥ 0.7 oder Ollama ≥ 0.6 (falls die GGUF-Variante veröffentlicht ist).

#Quantisierungen, die in 24–48 GB Speicher passen

Die konkrete Frage lautet: Was passt in den Speicher, ohne dass alles zusammenbricht? Die unten angegebenen Speicherbedarfe umfassen das Modell, einen KV-Cache für 8 k Kontext und den Laufzeit-Overhead. Sie setzen voraus, dass Sie den VRAM aller Ihrer Karten zusammenrechnen.

IQ1_M (≈ 110 GB)
Passt auf 2× 48 GB oder einen Mac Studio mit 128 GB. Geringere Qualität bei Code und längeren Schlussfolgerungen – zum Experimentieren geeignet, nicht für den produktiven Einsatz.
IQ2_XS (≈ 140 GB)
Mac Studio mit 192 GB oder 4× RTX 4090 mit 96 GB (mit Auslagerung von etwa 40 GB in den Arbeitsspeicher). Erste brauchbare Stufe für allgemeine Chats auf Französisch.
Q3_K_M (≈ 200 GB)
Mac Studio M3 Ultra oder M5 Ultra mit 256 GB oder 2× RTX 6000 Ada mit 96 GB + 128 GB RAM für das Offloading. Guter Kompromiss zwischen Qualität und Kosten.
Q4_K_M (≈ 270 GB)
Der optimale Punkt in puncto Qualität. Ein Mac Studio Ultra mit 256 GB kann das Modell mit kurzem Kontext ausführen; andernfalls 4× A6000 mit je 48 GB (192 GB) + Offloading oder ein DGX-Knoten.
Q5_K_M (≈ 330 GB)
Nur für H100 mit 80 GB ×4, MI300X mit 192 GB ×2 oder einen Cluster. In der Praxis nur ein geringer Vorteil gegenüber Q4.
Q8_0 (≈ 510 GB)
Nur im Rechenzentrum. Auf diesem Niveau bietet es sich an, das Modell mit vLLM im Tensorparallelbetrieb auf 8× H100 bereitzustellen.
→
Die richtige Standardwahl
Wenn Sie einen ernsthaften lokalen Einsatz anstreben, setzen Sie auf Q4_K_M und seien Sie bereit, in ausreichend VRAM-Gesamtkapazität zu investieren. Quantisierungen unter Q3 zeigen sichtbare Qualitätseinbußen, sobald die Aufgaben über einfache Chats hinausgehen – typischerweise bei der Generierung von langem Code oder beim Befolgen von Anweisungen mit mehreren Vorgaben.

#Installation

Drei Möglichkeiten je nach Ihrer Hardware. Ollama für eine einfache Nutzung, llama.cpp für mehr Kontrolle, vLLM, um mehrere Nutzer zu bedienen.

#Pfad 1: Ollama (Mac Studio Ultra)

Auf dem Mac Studio Ultra verwaltet Ollama den gemeinsamen Speicher automatisch. Der Daemon lauscht auf http://localhost:11434.

Terminal
# Vérifier qu'Ollama est à jour
ollama --version

# Télécharger la variante adaptée
ollama pull qwen3.7-max:q3_K_M

# Premier lancement (chargement long ~3 min)
ollama run qwen3.7-max:q3_K_M

Während des Ladens überwachen Sie im zweiten Terminal ollama ps. Die Spalte SIZE muss die erwartete Größe anzeigen (≈ 200 GB für Q3_K_M).

#Weg 2: llama.cpp (mehrere NVIDIA-GPUs)

Laden Sie die GGUF-Datei in Q4_K_M von Hugging Face herunter (Suche: Qwen3.7-Max-Instruct-GGUF, Modelle veröffentlicht vom Qwen-Team oder von bartowski). Der Download umfasst 270 GB – planen Sie entsprechend Bandbreite ein.

llama.cpp-Server mit Tensorparallelität
./llama-server \
  -m ./models/Qwen3.7-Max-Q4_K_M.gguf \
  --host 0.0.0.0 --port 8080 \
  -c 16384 \
  --tensor-split 24,24,24,24 \
  --main-gpu 0 \
  --flash-attn \
  --cache-type-k q8_0 --cache-type-v q8_0
--tensor-split 24,24,24,24
Verteilt die Schichten gleichmäßig auf 4 GPUs. An die verfügbaren GB pro Karte anpassen (z. B. 24,24 für 2 GPUs).
--cache-type-k q8_0
Quantisiert den KV-Cache und gibt etwa 30 % des VRAM frei; der Qualitätsverlust ist vernachlässigbar.
--flash-attn
Bei dieser Parameterzahl für Kontextlängen über 8 k unverzichtbar.
-c 16384
Eine Kontextlänge von 16 k ist ein guter Kompromiss. Eine Erhöhung auf 32 k benötigt beim 480B-Modell mehrere zusätzliche GB.

#Weg 3: vLLM (Produktionsbetrieb, mehrere Nutzer)

Wenn Sie ein Modell für ein Team bereitstellen, nutzt vLLM mit Tensor-Parallelismus die PCIe-Bandbreite besser aus und bietet einen deutlich höheren Batch-Durchsatz.

Start von vLLM
vllm serve Qwen/Qwen3.7-Max-Instruct-AWQ \
  --tensor-parallel-size 4 \
  --max-model-len 32768 \
  --quantization awq \
  --gpu-memory-utilization 0.92 \
  --enable-expert-parallel
i
AWQ vs GGUF
vLLM bevorzugt die Quantisierungen AWQ oder GPTQ, die für GPU NVIDIA optimiert sind. GGUF bleibt der König bei CPU/Mac und bei heterogenen Systemen. Bei einer reinen Maschine NVIDIA zeigt AWQ 4-Bit in vLLM einen höheren Durchsatz als GGUF Q4_K_M in llama.cpp bei Batchgeschwindigkeit (×2 bis ×3 je nach Last).

#Multi-GPU-Verteilung

Drei unterschiedliche Strategien je nach Ihrer Hardware und Auslastung.

  1. 01
    Layer split (Standard in llama.cpp)
    Jede GPU übernimmt einen zusammenhängenden Block von Schichten. Einfach, funktioniert mit heterogenen GPUs (z. B. 3090 + 4090). Engpass: Es rechnet jeweils nur eine GPU, die anderen warten. Der Durchsatz wird durch die langsamste Karte begrenzt.
  2. 02
    Tensor-Parallelismus (vLLM, neuere Versionen von llama.cpp)
    Jede Schicht wird horizontal auf alle GPUs aufgeteilt, die parallel rechnen. Erfordert eine ausreichende PCIe-Bandbreite (Gen4 x16 oder NVLink) und homogene Karten. Auf 4 GPUs ist der Durchsatz 1,8- bis 2,5-mal so hoch wie beim Layer-Split.
  3. 03
    Expertenparallelität (MoE-spezifisch)
    Verteilt die Experten auf die GPUs. Bei Qwen3.7 Max mit 128 Experten auf 4 Karten übernimmt jede GPU 32 Experten. Reduziert den VRAM-Bedarf pro Karte, aber jedes Token aktiviert Experten auf mehreren GPUs – eine gute Option, wenn PCIe Gen5 oder NVLink verfügbar ist.
→
PCIe zählt hier wirklich
Bei einem MoE dieser Größe erzeugt das Routing der Tokens zwischen den Experten einen ständigen Datenaustausch zwischen den GPUs. Ein Consumer-Mainboard mit PCIe Gen4 x4 im zweiten Steckplatz senkt den Durchsatz um 30–50 %. Wenn Sie ein Quad-GPU-System aufbauen, wählen Sie ein ThreadRipper- oder Xeon-System mit voller PCIe-Lane-Anbindung.
Die Verteilung auf mehrere GPUs prüfen
# Sous Linux, surveille la conso VRAM en direct
watch -n 1 nvidia-smi

# Avec llama.cpp, vérifie que tous les GPU travaillent
nvidia-smi dmon -s u -c 30

#Erwarteter Durchsatz in Tokens pro Sekunde

Messungen mit Q4_K_M (sofern nicht anders angegeben), Kontext 4 k, kurzer Prompt, Generierung von 512 Tokens, Batchgröße 1. Der Durchsatz sinkt logarithmisch mit der Kontextlänge — der Aufwand für die Prompt-Auswertung steigt jenseits von 16 k Tokens explosionsartig an.

Mac Studio M3 Ultra oder M5 Ultra 256 GB (Q3_K_M)
≈ 18–24 Tok/s bei der Generierung. Die Prompt-Evaluation bleibt korrekt (~600 Tok/s). Ideal für kontinuierliches, stilles Nutzung 24/7.
Mac Studio M2 Ultra 192 GB (IQ2_XS)
≈ 22–28 Tok/s, beeinträchtigte Qualität. Zum Testen akzeptabel, für den produktiven Einsatz ungeeignet.
2× RTX 6000 Ada 48 GB (Q3_K_M, layer split)
≈ 28–35 tok/s. Gute Option für eine professionelle Workstation.
4× RTX 4090 24 GB (Q4_K_M, tensor-parallel llama.cpp)
≈ 35–45 tok/s im Chat, 80–120 tok/s bei batch=4. Das beste Preis-Leistungs-Verhältnis bei einer selbst zusammengestellten Konfiguration.
4× RTX 4090 (vLLM AWQ tensor-parallel)
≈ 50–65 tok/s im Einzelchat, bis zu 300+ tok/s insgesamt bei großen Batches. Bevorzugte Lösung, um ein Team zu bedienen.
2× H100 80 GB (Q4_K_M, NVLink)
≈ 75–90 Tok/s im Chat. Für den professionellen Markt, aber NVLink verändert bei diesem Modellprofil alles.
i
Was diese Zahlen nicht zeigen
Bei einem MoE dieser Größe kann es bei einem Kontext von 32 k zwischen 8 und 15 Sekunden dauern, bis das erste Token erscheint. Für RAG oder lange Prompts sollten Sie Ihre Präfixe zwischenspeichern (Option --prompt-cache von llama.cpp oder Prefix Caching von vLLM) – erst dadurch wird die Nutzung erträglich.

#Open-Weight-Spitzenmodelle im Vergleich zur Cloud

Was rechtfertigt es bei vergleichbarer Leistung, Qwen3.7 Max lokal zu betreiben, statt für eine API zu bezahlen?

Echte Vertraulichkeit
Die Prompts verlassen Ihr Netzwerk nie. Für Anwälte, medizinische Dienste und HR-Teams ist das nicht verhandelbar – und keine „Zero Retention“-Richtlinie eines Cloud-Anbieters kommt einem Air-Gap gleich.
Keine Grenzkosten
Sobald sich die Hardwareinvestition amortisiert hat, ist jeder Token kostenlos. Bei intensiven Arbeitslasten (synthetische Datensatzgenerierung, Stapelverarbeitung von Analysen) übertrifft der ROI innerhalb weniger Monate den des Cloud-Betriebs.
Tiefgreifende Anpassung
Sie können das Modell feinabstimmen, den Standard-System-Prompt ändern, eigene Tools anbinden und die logprobs abfangen. Keine API eines Frontier-Modells bietet das.
Anbieterunabhängigkeit
Keine Kontingente, keine Rate-Limits, kein Modell, das bei der nächsten Preisanpassung verschwindet. Das Modell bleibt auf Ihrer Festplatte.
Vorhersagbare Latenz
Keine Serverüberlastung, kein "the model is overloaded" mitten in einer Kundendemo.
!
Wo der Cloud-Service noch vorne ist
Für gelegentliche interaktive Nutzung mit sehr niedriger Latenz oder zur Verarbeitung von Hunderten Anfragen pro Sekunde bleibt die Cloud wirtschaftlicher. Lokal spielt Qwen3.7 Max seine Stärken bei anhaltender Batch-Last aus, nicht bei gelegentlichen Lastspitzen – dieselbe Logik wie beim Vergleich zwischen einem On-Premises-Server und SaaS.

#Fehlerbehebung

OOM beim Laden auf einem System mit vier 4090-GPUs
Prüfen, ob die Summe der Werte von --tensor-split dem tatsächlich verfügbaren VRAM entspricht (nicht dem angezeigten VRAM). Pro Karte 1–2 GB Spielraum für den CUDA-Overhead lassen.
Geschwindigkeit unter 10 Tok/s
Sehr wahrscheinlich ein GPU, der die System-RAM überschreitet. nvidia-smi zeigt 100 % genutzte VRAM und eine Karte mit einer Nutzung von maximal 30 %. Verringern Sie die Quantisierung oder fügen Sie mehr VRAM hinzu.
Time-to-first-token > 30 Sekunden
Die Phase der Prompt-Auswertung ist ausgelastet. Aktivieren Sie --flash-attn, quantisieren Sie den KV-Cache und reduzieren Sie num_ctx auf das unbedingt Notwendige. Bündeln Sie Ihre Anfragen nach Möglichkeit zu Batches.
Qualität im freien Fall im Vergleich zu Benchmarkwerten
Prüfen Sie, ob Sie tatsächlich die Instruct-Variante (und nicht Base) verwenden, ob das Chat-Template angewendet wird (Ollama tut dies, llama.cpp ohne --chat-template nicht) und ob die Quantisierung nicht unter Q3 gefallen ist.
Crash nach einigen Stunden
Oft liegt es an der Wärmeentwicklung: 4 GPUs mit 100 % Auslastung heizen das Gehäuse auf. Prüfen Sie die Junction-Temperaturen, passen Sie die Lüfterkurven an und verwenden Sie einen Undervolting-Offset von −50 mV bis −100 mV. Siehe den Leitfaden zum Wärmemanagement.
Extreme Langsamkeit beim allerersten Prompt
Das Modell wird von der SSD geladen – rechnen Sie bei 270 GB mit 2 bis 5 Minuten. Nachfolgende Prompts werden sofort verarbeitet, solange das Modell im Speicher bleibt.

#Weiterführende Informationen

Qwen3.7 Max erfordert eine erhebliche Investition in Hardware. Hier sind einige weiterführende Anleitungen, um das Setup vor dem Kauf richtig zu dimensionieren:

Multi-GPU-Setup mit llama.cpp
Der praktische Leitfaden zum Verteilen eines großen Modells auf 2 oder 4 NVIDIA-GPUs, einschließlich der Fallstricke bei PCIe und NVLink.
Welches LLM auf dem Mac Studio (M2/M3/M4 Ultra, 64–512 GB)?
Vergleichen, was Apples einheitlicher Speicher gegenüber einer NVIDIA-Multi-GPU-Konfiguration für Modelle dieser Größenordnung ermöglicht.
vLLM in der Produktion einsetzen
Wenn Qwen3.7 Max mehrere Benutzer gleichzeitig bedienen muss, ist vLLM mit tensor-parallel die geeignete Lösung.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.