Qwen3.7 Max lokal: das Beste unter den Open-Weights-Modellen selbst hostbar
Qwen3.7 Max ist der größte open-weight-Modell von Alibaba bislang: ein MoE von Frontierschicht, konzipiert, um mit hochwertigen proprietären Modellen zu konkurrieren. Die lokale Ausführung von qwen3.7 max local ist kein Aufwand für den Alltag – dafür benötigt man ernsthafte Hardware und etwas Organisation. Dieser Leitfaden zeigt die tatsächlich auf 24 bis 48 GB pro Karte passierbaren Quantisierungen auf, wie der Modell auf mehrere GPU verteilt werden kann, den erwarteten Durchsatz und die Fälle, in denen er die Cloud-APIs vollständig übertrifft.
#Warum Qwen3.7 Max?
In nahezu allen öffentlichen Benchmarks von Ende 2026 belegt Qwen3.7 Max den ersten Platz unter den Open-Weight-Modellen: mehrstufiges Schlussfolgern, Code, Mathematik, Befolgen langer Anweisungen auf Chinesisch und Englisch — und Französischkenntnisse, für die es sich nicht mehr schämen muss. Auf diesem Niveau gibt es keinen technischen Grund mehr, Prompts an einen Cloud-Anbieter zu senden, außer wenn ein enorm hoher Durchsatz benötigt wird.
Das Modell wird unter der Tongyi Qianwen-Lizenz verbreitet (Apache-2.0 für die meisten Gewichte). Die Varianten Instruct, Coder und Thinking werden auf Hugging Face veröffentlicht und auch auf ollama.com/library angeboten. Für alle, die über eine gut ausgestattete KI-Workstation verfügen, ist es derzeit das überzeugendste Open-Weight-Modell gegenüber GPT-5 Mini oder Claude Sonnet 4.
#Der Modellüberblick
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
- Architektur
- Mixture-of-Experts. Etwa 480 Milliarden Parameter insgesamt, ~46 Milliarden aktive Parameter pro Token (8 von 128 Experten werden per Routing ausgewählt).
- Nativer Kontext
- 256 k Tokens über YaRN, 1 M Token in der experimentellen Erweiterung. Der Großteil der Anwendungen bleibt unter 32 k.
- Tokenizer
- Mehrsprachige BPE nach dem Vorbild von Tiktoken, kompaktes Token-Wort-Verhältnis im Französischen (≈ 1,4 Token/Wort – vergleichbar mit GPT-4).
- Varianten
- Qwen3.7-Max-Instruct (allgemeiner Chat), -Coder (Programmierung), -Thinking (explizites Schlussfolgern wie bei DeepSeek R1).
- Lizenz
- Apache-2.0 für die Hauptgewichte. Kommerzieller Einsatz erlaubt, Weiterverteilung erlaubt, strenge Wettbewerbsverbote nicht vorhanden.
#Hardware-Voraussetzungen
- Gesamter VRAM (Q4_K_M)
- ≈ 270 GB für das Modell + KV-Cache einplanen. Das ist die Zielgröße für Multi-GPU-Konfigurationen oder einen Mac Studio Ultra mit 256 GB.
- Minimale praxistaugliche Workstation
- Mac Studio M2 Ultra mit 192 GB (Q3_K_M, Kontext 8 k) — das einzige Einzelrechner-Setup für den Verbrauchermarkt, das ohne zwei GPUs auskommt.
- Komfortable Workstation
- 4× RTX 4090 mit je 24 GB (insgesamt 96 GB, Q2_K + Offloading), oder 2× RTX 6000 Ada mit je 48 GB, oder ein Mac Studio M3 Ultra oder M5 Ultra mit 256 GB für das vollständige Modell in Q4_K_M.
- System-RAM
- Mindestens 128 GB, wenn Sie Experten in den Arbeitsspeicher auslagern möchten. 256 GB empfohlen, wenn Sie das Modell ausschließlich in den Arbeitsspeicher laden (sehr langsam, aber funktionsfähig).
- Festplatte
- ≈ 270 GB für Q4_K_M, ≈ 1 TB für FP16. Eine Gen4-NVMe-SSD ist erforderlich – sonst dauert das anfängliche Laden 20 Minuten oder länger.
- Runtime
- llama.cpp-Build nach Oktober 2026 (Unterstützung für Tensorparallelität bei MoE-Modellen), vLLM ≥ 0.7 oder Ollama ≥ 0.6 (falls die GGUF-Variante veröffentlicht ist).
#Quantisierungen, die in 24–48 GB Speicher passen
Die konkrete Frage lautet: Was passt in den Speicher, ohne dass alles zusammenbricht? Die unten angegebenen Speicherbedarfe umfassen das Modell, einen KV-Cache für 8 k Kontext und den Laufzeit-Overhead. Sie setzen voraus, dass Sie den VRAM aller Ihrer Karten zusammenrechnen.
- IQ1_M (≈ 110 GB)
- Passt auf 2× 48 GB oder einen Mac Studio mit 128 GB. Geringere Qualität bei Code und längeren Schlussfolgerungen – zum Experimentieren geeignet, nicht für den produktiven Einsatz.
- IQ2_XS (≈ 140 GB)
- Mac Studio mit 192 GB oder 4× RTX 4090 mit 96 GB (mit Auslagerung von etwa 40 GB in den Arbeitsspeicher). Erste brauchbare Stufe für allgemeine Chats auf Französisch.
- Q3_K_M (≈ 200 GB)
- Mac Studio M3 Ultra oder M5 Ultra mit 256 GB oder 2× RTX 6000 Ada mit 96 GB + 128 GB RAM für das Offloading. Guter Kompromiss zwischen Qualität und Kosten.
- Q4_K_M (≈ 270 GB)
- Der optimale Punkt in puncto Qualität. Ein Mac Studio Ultra mit 256 GB kann das Modell mit kurzem Kontext ausführen; andernfalls 4× A6000 mit je 48 GB (192 GB) + Offloading oder ein DGX-Knoten.
- Q5_K_M (≈ 330 GB)
- Nur für H100 mit 80 GB ×4, MI300X mit 192 GB ×2 oder einen Cluster. In der Praxis nur ein geringer Vorteil gegenüber Q4.
- Q8_0 (≈ 510 GB)
- Nur im Rechenzentrum. Auf diesem Niveau bietet es sich an, das Modell mit vLLM im Tensorparallelbetrieb auf 8× H100 bereitzustellen.
#Installation
Drei Möglichkeiten je nach Ihrer Hardware. Ollama für eine einfache Nutzung, llama.cpp für mehr Kontrolle, vLLM, um mehrere Nutzer zu bedienen.
#Pfad 1: Ollama (Mac Studio Ultra)
Auf dem Mac Studio Ultra verwaltet Ollama den gemeinsamen Speicher automatisch. Der Daemon lauscht auf http://localhost:11434.
Während des Ladens überwachen Sie im zweiten Terminal ollama ps. Die Spalte SIZE muss die erwartete Größe anzeigen (≈ 200 GB für Q3_K_M).
#Weg 2: llama.cpp (mehrere NVIDIA-GPUs)
Laden Sie die GGUF-Datei in Q4_K_M von Hugging Face herunter (Suche: Qwen3.7-Max-Instruct-GGUF, Modelle veröffentlicht vom Qwen-Team oder von bartowski). Der Download umfasst 270 GB – planen Sie entsprechend Bandbreite ein.
- --tensor-split 24,24,24,24
- Verteilt die Schichten gleichmäßig auf 4 GPUs. An die verfügbaren GB pro Karte anpassen (z. B. 24,24 für 2 GPUs).
- --cache-type-k q8_0
- Quantisiert den KV-Cache und gibt etwa 30 % des VRAM frei; der Qualitätsverlust ist vernachlässigbar.
- --flash-attn
- Bei dieser Parameterzahl für Kontextlängen über 8 k unverzichtbar.
- -c 16384
- Eine Kontextlänge von 16 k ist ein guter Kompromiss. Eine Erhöhung auf 32 k benötigt beim 480B-Modell mehrere zusätzliche GB.
#Weg 3: vLLM (Produktionsbetrieb, mehrere Nutzer)
Wenn Sie ein Modell für ein Team bereitstellen, nutzt vLLM mit Tensor-Parallelismus die PCIe-Bandbreite besser aus und bietet einen deutlich höheren Batch-Durchsatz.
#Multi-GPU-Verteilung
Drei unterschiedliche Strategien je nach Ihrer Hardware und Auslastung.
- 01Layer split (Standard in llama.cpp)Jede GPU übernimmt einen zusammenhängenden Block von Schichten. Einfach, funktioniert mit heterogenen GPUs (z. B. 3090 + 4090). Engpass: Es rechnet jeweils nur eine GPU, die anderen warten. Der Durchsatz wird durch die langsamste Karte begrenzt.
- 02Tensor-Parallelismus (vLLM, neuere Versionen von llama.cpp)Jede Schicht wird horizontal auf alle GPUs aufgeteilt, die parallel rechnen. Erfordert eine ausreichende PCIe-Bandbreite (Gen4 x16 oder NVLink) und homogene Karten. Auf 4 GPUs ist der Durchsatz 1,8- bis 2,5-mal so hoch wie beim Layer-Split.
- 03Expertenparallelität (MoE-spezifisch)Verteilt die Experten auf die GPUs. Bei Qwen3.7 Max mit 128 Experten auf 4 Karten übernimmt jede GPU 32 Experten. Reduziert den VRAM-Bedarf pro Karte, aber jedes Token aktiviert Experten auf mehreren GPUs – eine gute Option, wenn PCIe Gen5 oder NVLink verfügbar ist.
#Erwarteter Durchsatz in Tokens pro Sekunde
Messungen mit Q4_K_M (sofern nicht anders angegeben), Kontext 4 k, kurzer Prompt, Generierung von 512 Tokens, Batchgröße 1. Der Durchsatz sinkt logarithmisch mit der Kontextlänge — der Aufwand für die Prompt-Auswertung steigt jenseits von 16 k Tokens explosionsartig an.
- Mac Studio M3 Ultra oder M5 Ultra 256 GB (Q3_K_M)
- ≈ 18–24 Tok/s bei der Generierung. Die Prompt-Evaluation bleibt korrekt (~600 Tok/s). Ideal für kontinuierliches, stilles Nutzung 24/7.
- Mac Studio M2 Ultra 192 GB (IQ2_XS)
- ≈ 22–28 Tok/s, beeinträchtigte Qualität. Zum Testen akzeptabel, für den produktiven Einsatz ungeeignet.
- 2× RTX 6000 Ada 48 GB (Q3_K_M, layer split)
- ≈ 28–35 tok/s. Gute Option für eine professionelle Workstation.
- 4× RTX 4090 24 GB (Q4_K_M, tensor-parallel llama.cpp)
- ≈ 35–45 tok/s im Chat, 80–120 tok/s bei batch=4. Das beste Preis-Leistungs-Verhältnis bei einer selbst zusammengestellten Konfiguration.
- 4× RTX 4090 (vLLM AWQ tensor-parallel)
- ≈ 50–65 tok/s im Einzelchat, bis zu 300+ tok/s insgesamt bei großen Batches. Bevorzugte Lösung, um ein Team zu bedienen.
- 2× H100 80 GB (Q4_K_M, NVLink)
- ≈ 75–90 Tok/s im Chat. Für den professionellen Markt, aber NVLink verändert bei diesem Modellprofil alles.
#Open-Weight-Spitzenmodelle im Vergleich zur Cloud
Was rechtfertigt es bei vergleichbarer Leistung, Qwen3.7 Max lokal zu betreiben, statt für eine API zu bezahlen?
- Echte Vertraulichkeit
- Die Prompts verlassen Ihr Netzwerk nie. Für Anwälte, medizinische Dienste und HR-Teams ist das nicht verhandelbar – und keine „Zero Retention“-Richtlinie eines Cloud-Anbieters kommt einem Air-Gap gleich.
- Keine Grenzkosten
- Sobald sich die Hardwareinvestition amortisiert hat, ist jeder Token kostenlos. Bei intensiven Arbeitslasten (synthetische Datensatzgenerierung, Stapelverarbeitung von Analysen) übertrifft der ROI innerhalb weniger Monate den des Cloud-Betriebs.
- Tiefgreifende Anpassung
- Sie können das Modell feinabstimmen, den Standard-System-Prompt ändern, eigene Tools anbinden und die logprobs abfangen. Keine API eines Frontier-Modells bietet das.
- Anbieterunabhängigkeit
- Keine Kontingente, keine Rate-Limits, kein Modell, das bei der nächsten Preisanpassung verschwindet. Das Modell bleibt auf Ihrer Festplatte.
- Vorhersagbare Latenz
- Keine Serverüberlastung, kein "the model is overloaded" mitten in einer Kundendemo.
#Fehlerbehebung
- OOM beim Laden auf einem System mit vier 4090-GPUs
- Prüfen, ob die Summe der Werte von --tensor-split dem tatsächlich verfügbaren VRAM entspricht (nicht dem angezeigten VRAM). Pro Karte 1–2 GB Spielraum für den CUDA-Overhead lassen.
- Geschwindigkeit unter 10 Tok/s
- Sehr wahrscheinlich ein GPU, der die System-RAM überschreitet. nvidia-smi zeigt 100 % genutzte VRAM und eine Karte mit einer Nutzung von maximal 30 %. Verringern Sie die Quantisierung oder fügen Sie mehr VRAM hinzu.
- Time-to-first-token > 30 Sekunden
- Die Phase der Prompt-Auswertung ist ausgelastet. Aktivieren Sie --flash-attn, quantisieren Sie den KV-Cache und reduzieren Sie num_ctx auf das unbedingt Notwendige. Bündeln Sie Ihre Anfragen nach Möglichkeit zu Batches.
- Qualität im freien Fall im Vergleich zu Benchmarkwerten
- Prüfen Sie, ob Sie tatsächlich die Instruct-Variante (und nicht Base) verwenden, ob das Chat-Template angewendet wird (Ollama tut dies, llama.cpp ohne --chat-template nicht) und ob die Quantisierung nicht unter Q3 gefallen ist.
- Crash nach einigen Stunden
- Oft liegt es an der Wärmeentwicklung: 4 GPUs mit 100 % Auslastung heizen das Gehäuse auf. Prüfen Sie die Junction-Temperaturen, passen Sie die Lüfterkurven an und verwenden Sie einen Undervolting-Offset von −50 mV bis −100 mV. Siehe den Leitfaden zum Wärmemanagement.
- Extreme Langsamkeit beim allerersten Prompt
- Das Modell wird von der SSD geladen – rechnen Sie bei 270 GB mit 2 bis 5 Minuten. Nachfolgende Prompts werden sofort verarbeitet, solange das Modell im Speicher bleibt.
#Weiterführende Informationen
Qwen3.7 Max erfordert eine erhebliche Investition in Hardware. Hier sind einige weiterführende Anleitungen, um das Setup vor dem Kauf richtig zu dimensionieren:
- Multi-GPU-Setup mit llama.cpp
- Der praktische Leitfaden zum Verteilen eines großen Modells auf 2 oder 4 NVIDIA-GPUs, einschließlich der Fallstricke bei PCIe und NVLink.
- Welches LLM auf dem Mac Studio (M2/M3/M4 Ultra, 64–512 GB)?
- Vergleichen, was Apples einheitlicher Speicher gegenüber einer NVIDIA-Multi-GPU-Konfiguration für Modelle dieser Größenordnung ermöglicht.
- vLLM in der Produktion einsetzen
- Wenn Qwen3.7 Max mehrere Benutzer gleichzeitig bedienen muss, ist vLLM mit tensor-parallel die geeignete Lösung.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.