Qwen 3.8 Open Weights: Veröffentlichung am 14. August 2026
Die offenen Gewichte von Qwen 3.8 sind erschienen: Alibaba hat Qwen3.8-27B am 14. August 2026 auf Hugging Face unter der Lizenz Apache 2.0 veröffentlicht. Kurz darauf folgte ein offizieller Ollama-Tag. Dieser Leitfaden zeichnet die vollständige Chronologie nach – von der Ankündigung auf der WAIC Ende Juli über den Start von Qwen 3.8-Max per API am 3. August bis zur Veröffentlichung der Gewichte – und erklärt die anhaltende Verwechslung zwischen dem proprietären Max, der nicht lokal betrieben werden kann, und dem dichten 27B-Modell, das Sie zu Hause installieren können. Eine Schritt-für-Schritt-Anleitung zur Installation finden Sie in unserem speziellen Leitfaden zum lokalen Betrieb von Qwen 3.8 27B.
#Das Wichtigste in einer Minute
Wenn Sie nach einem Ollama-Tag für Qwen 3.8 suchen: Es gibt ihn seit dem 14. August 2026: „ollama run qwen3.8:27b“. Bevor Sie weitermachen, sollten Sie verstehen, dass die Generation 3.8 zwei sehr unterschiedliche Modelle umfasst – ein riesiges proprietäres Modell, das über eine API bereitgestellt wird, und ein dichtes Modell mit 27 Milliarden Parametern, das Sie herunterladen können.
- Qwen 3.8-Max
- Flaggschiff-Modell von Alibaba, MoE mit etwa 2.400 Milliarden Parametern, Kontext 1M. Verfügbar über die Alibaba Cloud API seit dem 3. August 2026. Proprietär, nicht herunterladbar – es ist kein lokales Modell.
- Qwen3.8-27B (offene Gewichte)
- Dichte multimodale Version, veröffentlicht am 14. August 2026 auf Hugging Face unter der Apache-2.0-Lizenz. Natives Kontextfenster mit 262.144 Tokens, 18 GB in Q4_K_M, offizieller Ollama-Tag qwen3.8:27b.
- Was Sie heute bereits tun können
- Das 27B-Modell direkt auf einer Karte mit 24 GB oder einem Mac mit 32 GB installieren. Unser Installationsleitfaden erläutert den Befehl, die Quantisierungen und die Einstellungen.
#Überprüfte Chronologie: von WAIC bis zur API
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Ein Großteil der Verwirrung um Qwen 3.8 entsteht dadurch, dass eine Konferenzdemo mit einer Produktveröffentlichung verwechselt wird. Hier ist der Ablauf in der richtigen Reihenfolge.
- 01Ende Juli 2026 — WAIC (Shanghai)Alibaba stellt die Modellgeneration Qwen 3.8 auf der World Artificial Intelligence Conference vor. Dort werden die ersten Zahlen genannt (Kontext 1M, massive MoE-Architektur) und die Absicht angekündigt, eine Open-Weight-Variante zu veröffentlichen. Zu diesem Zeitpunkt lässt sich noch nichts herunterladen: Es handelt sich um Ankündigungen.
- 023. August 2026 — Start von Qwen 3.8-Max über die APIDas proprietäre Modell wird über die API von Alibaba Cloud (DashScope) und die Qwen-App zugänglich. Es handelt sich um eine tatsächliche Veröffentlichung, allerdings ausschließlich in der Cloud. Die veröffentlichten Benchmarks stammen aus diesem Zeitraum.
- 033. bis 13. August 2026 — Warten auf die ModellgewichteDie Community wartet auf das auf der WAIC erwähnte Qwen3.8-27B mit offenen Modellgewichten. In den üblichen Repositories (huggingface.co/Qwen, ModelScope) werden in diesem Zeitraum keine Gewichte der Generation 3.8 veröffentlicht, was Zweifel daran nährt, ob die Ankündigung eingehalten wird.
- 0414. August 2026 — Veröffentlichung der Qwen3.8-27B-GewichteAlibaba veröffentlicht das Repository Qwen/Qwen3.8-27B auf Hugging Face unter der Apache-2.0-Lizenz: ein dichtes Modell mit 27 Milliarden Parametern, nativen Bild-Sprach-Fähigkeiten und einem Kontextfenster von 262.144 Tokens. Die Ollama-Bibliothek führt noch am selben Tag den offiziellen Tag mit zwölf Varianten auf (Q4_K_M, Q8, BF16, MLX-Builds für Apple Silicon). Zwischen dem API-Start von Max und der Veröffentlichung der offenen Modellgewichte liegen somit elf Tage.
#Was tatsächlich veröffentlicht wurde: Qwen 3.8-Max
Qwen 3.8-Max ist das einzige Modell dieser Generation, das heute tatsächlich verfügbar ist. Dabei muss klar sein: Es ist kein Modell, das Sie zu Hause betreiben können. Seine Größe schließt Self-Hosting für Privatanwender aus, und seine Gewichte sind ohnehin nicht veröffentlicht.
- Architektur
- Mixture-of-Experts-Modell mit insgesamt etwa 2,4 Billionen Parametern, von denen pro Token nur ein Teil aktiv ist. Es lässt sich nicht auf Hardware für Privatanwender laden, auch nicht auf sehr hochwertige Systeme.
- Kontext
- Angekündigtes Kontextfenster von 1 Million Tokens, ausgelegt auf lange Dokumente und vollständige Codebasen.
- Verfügbarkeit
- API von Alibaba Cloud (DashScope) und Qwen-Anwendung. Nutzungsabhängige Abrechnung, kein Download der Modellgewichte.
- Positionierung
- Direkter Konkurrent der führenden proprietären Modelle. Mit Cloud-Angeboten vergleichen, nicht mit lokalen Modellen.
#Offene Gewichte: Was versprochen wird und was geliefert wird
Die Einordnung ist nun einfach: Was auf der WAIC angekündigt wurde, wurde tatsächlich geliefert, mit elf Tagen Abstand zum API-Modell. Hier ist die sachliche Bilanz.
- Versprochen
- Ein dichtes Open-Weight-Modell Qwen3.8-27B unter einer permissiven Lizenz, das in quantisierter Form auf eine GPU mit 24 GB Speicher passen soll.
- Geliefert
- Genau das, am 14. August 2026: Modellgewichte im safetensors-Format auf Hugging Face, Apache-2.0-Lizenz, GGUF und MLX-Builds über Ollama verteilt, 18 GB in Q4_K_M – damit klar innerhalb der angestrebten 24 GB.
- Zusätzlich
- Die native Vision (Bilder und Videos) sowie ein Kontext von 262.144 Tokens, erweiterbar auf 1M über YaRN, was nicht in den ursprünglichen Ankündigungen garantiert war.
#Die Veröffentlichung vom 14. August auf Hugging Face
Das offizielle Repository bleibt die verlässlichste Quelle für die Verfügbarkeit. Hier erfahren Sie, wie Sie selbst prüfen können – heute ebenso wie bei der nächsten Generation und auch, um die Angaben in diesem Artikel zu überprüfen, der seinerseits veralten wird.
Das offizielle Repository ist Qwen/Qwen3.8-27B. Seine Modellkarte nennt 27 Milliarden Parameter, 64 Schichten, hybride Attention, native Bildverarbeitung und die Apache-2.0-Lizenz. Bei Ollama sind zwölf Varianten veröffentlicht, von Q4_K_M mit 18 GB bis BF16 mit 56 GB.
#Sollte man von Qwen 3.6 wechseln?
Wenn Sie bereits Qwen 3.6-27B einsetzen, lautet die Frage nicht mehr „Was installiere ich in der Zwischenzeit?“, sondern „Lohnt sich der Download des Updates?“. Kurze Antwort: Ja, bei gleichem Speicherbedarf – behalten Sie aber das alte Modell, bis Sie Ihre Prompts erneut überprüft haben.
- Qwen3.8-27B
- Gleiche Größenordnung wie die 3.6-27B (24 GB VRAM in Q4), Lizenz Apache 2.0, native Bildverarbeitung, Kontext 262k. Die veröffentlichten Scores steigen vor allem beim agentischen Programmieren und bei der Computerbedienung.
- Qwen 3.6-27B
- Weiterhin eine gute Wahl: stabil, bewährt, hervorragend auf Französisch. Wenn Sie das Modell für Gespräche nutzen, müssen Sie nicht wechseln.
- Qwen3-Coder-Next
- Das auf Code spezialisierte Modell bleibt bei der Autovervollständigung schneller. Qwen 3.8 27B lohnt sich, wenn ein Agent mehrere Dateien lesen, Änderungen planen und die Dateien bearbeiten muss.
Eine schnelle Orientierung zum Speicherbedarf in Q4_K_M, um die Hardware richtig zu dimensionieren: Ein 14B-Modell benötigt etwa 9 GB VRAM, ein 27–32B-Modell etwa 19 GB und ein 70B-Modell etwa 40 GB. Für ein 27B-Modell in Q4 sollte man daher eine Karte mit 24 GB (RTX 4090, RTX 3090) oder einen Mac mit mindestens 24 GB gemeinsamem Arbeitsspeicher einplanen.
- RTX 3060 12 GB
- Gut geeignet für 8–14B-Modelle. Das 27B-Modell passt nicht vollständig hinein – Teile werden auf die CPU ausgelagert, was den Betrieb verlangsamt.
- RTX 4090 / 3090 (24 GB)
- Die ideale Wahl für ein 27–32B-Modell in Q4_K_M, vollständig auf der GPU.
- Mac M4 Pro (24–48 GB vereinheitlichter Speicher)
- Das 27B-Modell läuft dank des vereinheitlichten Speichers sehr gut; planen Sie für lange Kontexte mindestens 32 GB ein.
#Installieren: der kürzeste Weg
Die vollständige Installation – Quantisierungen, MLX-Variante auf dem Mac, Kontexteinstellungen, Thinking-Modus und Fehlerbehebung – wird in einem eigenen Leitfaden behandelt. Hier ist die Zusammenfassung in drei Befehlen.
- 011. Ollama aktualisierenDie hybriden Schichten von Qwen 3.8 erfordern eine aktuelle Version der Engine. Eine Version von vor August 2026 gibt einen Architekturfehler zurück.
- 022. Modell herunterladen18 GB in Q4_K_M, dem Standardformat. Bevorzugen Sie auf einem Mac mit Apple Silicon den Tag -mlx.
- 033. Die Verteilung prüfenollama ps indique si le modèle tourne entièrement sur le GPU. Tant que ce n'est pas 100 % GPU, le débit reste médiocre.
Für reine Programmieraufgaben bleibt die spezialisierte Variante der vorherigen Generation relevant und ist weniger ressourcenintensiv.
#Was man sich merken sollte
Die Episode rund um Qwen 3.8 ist ein Lehrbeispiel für die Verwechslung von Ankündigung, API-Veröffentlichung und Veröffentlichung der Modellgewichte. Hier sind die überprüften Fakten mit Datum.
- Der Ollama-Tag
- qwen3.8:27b, veröffentlicht am 14. August 2026, 18 GB in Q4_K_M. Insgesamt zwölf Varianten, darunter zwei MLX-Builds für Apple Silicon.
- Die Lizenz
- Apache 2.0: kommerzielle Nutzung, Änderung und Verteilung erlaubt, ohne Benutzergrenze oder nutzungsbeschränkende Klauseln.
- Die veröffentlichten Modellgrößen
- Derzeit gibt es nur eine Größe als dichtes Modell: 27B. Bis heute wurde keine kleinere Variante der Generation 3.8 veröffentlicht.
- Die Benchmarkergebnisse
- Die verfügbaren Ergebnisse stammen aus der offiziellen Modellkarte. Bisher wurde keine unabhängige Reproduktion veröffentlicht.
#Weiterführende Informationen
Für den Übergang von der Chronologie zur Praxis führen diese Leitfäden den vorliegenden Leitfaden weiter:
- Qwen 3.8 27B lokal
- Die vollständige Installationsanleitung: Ollama-Befehl, VRAM je nach Quantisierung, MLX-Variante auf dem Mac, Fallstrick beim 256k-Kontext und Einstellungen des Thinking-Modus.
- Ollama korrekt installieren
- „Ollama installieren: Windows, macOS und Linux“ erläutert die RAM- und GPU-Voraussetzungen sowie das erste Modell, das Sie starten sollten, wenn Sie bei null anfangen.
- Die richtige Quantisierung wählen
- „Die Quantisierung wählen (Q4, Q5, Q8, FP16)“ erklärt den Kompromiss zwischen Qualität und Speicherbedarf – entscheidend, damit ein 27B-Modell in 24 GB Speicher passt.
- Die GPU dimensionieren
- „Die richtige GPU für lokale KI auswählen“ hilft Ihnen, den VRAM-Bedarf nicht zu unterschätzen, bevor Sie eine GPU für ein künftiges 27B-Modell kaufen.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.