Einsteiger 8 minNeuigkeiten

Qwen 3.8 Open Weights: Veröffentlichung am 14. August 2026

Die offenen Gewichte von Qwen 3.8 sind erschienen: Alibaba hat Qwen3.8-27B am 14. August 2026 auf Hugging Face unter der Lizenz Apache 2.0 veröffentlicht. Kurz darauf folgte ein offizieller Ollama-Tag. Dieser Leitfaden zeichnet die vollständige Chronologie nach – von der Ankündigung auf der WAIC Ende Juli über den Start von Qwen 3.8-Max per API am 3. August bis zur Veröffentlichung der Gewichte – und erklärt die anhaltende Verwechslung zwischen dem proprietären Max, der nicht lokal betrieben werden kann, und dem dichten 27B-Modell, das Sie zu Hause installieren können. Eine Schritt-für-Schritt-Anleitung zur Installation finden Sie in unserem speziellen Leitfaden zum lokalen Betrieb von Qwen 3.8 27B.

Von Mohamed Meguedmi·Aktualisierung 2026-08-18·Unter Windows, macOS und Linux getestet

#Das Wichtigste in einer Minute

Wenn Sie nach einem Ollama-Tag für Qwen 3.8 suchen: Es gibt ihn seit dem 14. August 2026: „ollama run qwen3.8:27b“. Bevor Sie weitermachen, sollten Sie verstehen, dass die Generation 3.8 zwei sehr unterschiedliche Modelle umfasst – ein riesiges proprietäres Modell, das über eine API bereitgestellt wird, und ein dichtes Modell mit 27 Milliarden Parametern, das Sie herunterladen können.

Qwen 3.8-Max
Flaggschiff-Modell von Alibaba, MoE mit etwa 2.400 Milliarden Parametern, Kontext 1M. Verfügbar über die Alibaba Cloud API seit dem 3. August 2026. Proprietär, nicht herunterladbar – es ist kein lokales Modell.
Qwen3.8-27B (offene Gewichte)
Dichte multimodale Version, veröffentlicht am 14. August 2026 auf Hugging Face unter der Apache-2.0-Lizenz. Natives Kontextfenster mit 262.144 Tokens, 18 GB in Q4_K_M, offizieller Ollama-Tag qwen3.8:27b.
Was Sie heute bereits tun können
Das 27B-Modell direkt auf einer Karte mit 24 GB oder einem Mac mit 32 GB installieren. Unser Installationsleitfaden erläutert den Befehl, die Quantisierungen und die Einstellungen.
i
Leitfaden aktualisiert am 18. August 2026
Diese Bestandsaufnahme wurde nach der tatsächlichen Veröffentlichung der Gewichte neu verfasst. Das Qwen-Ökosystem entwickelt sich schnell: Die offizielle Seite huggingface.co/Qwen und die Ollama-Bibliothek bleiben die einzigen maßgeblichen Quellen für die Verfügbarkeit eines Modells.

#Überprüfte Chronologie: von WAIC bis zur API

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Ein Großteil der Verwirrung um Qwen 3.8 entsteht dadurch, dass eine Konferenzdemo mit einer Produktveröffentlichung verwechselt wird. Hier ist der Ablauf in der richtigen Reihenfolge.

  1. 01
    Ende Juli 2026 — WAIC (Shanghai)
    Alibaba stellt die Modellgeneration Qwen 3.8 auf der World Artificial Intelligence Conference vor. Dort werden die ersten Zahlen genannt (Kontext 1M, massive MoE-Architektur) und die Absicht angekündigt, eine Open-Weight-Variante zu veröffentlichen. Zu diesem Zeitpunkt lässt sich noch nichts herunterladen: Es handelt sich um Ankündigungen.
  2. 02
    3. August 2026 — Start von Qwen 3.8-Max über die API
    Das proprietäre Modell wird über die API von Alibaba Cloud (DashScope) und die Qwen-App zugänglich. Es handelt sich um eine tatsächliche Veröffentlichung, allerdings ausschließlich in der Cloud. Die veröffentlichten Benchmarks stammen aus diesem Zeitraum.
  3. 03
    3. bis 13. August 2026 — Warten auf die Modellgewichte
    Die Community wartet auf das auf der WAIC erwähnte Qwen3.8-27B mit offenen Modellgewichten. In den üblichen Repositories (huggingface.co/Qwen, ModelScope) werden in diesem Zeitraum keine Gewichte der Generation 3.8 veröffentlicht, was Zweifel daran nährt, ob die Ankündigung eingehalten wird.
  4. 04
    14. August 2026 — Veröffentlichung der Qwen3.8-27B-Gewichte
    Alibaba veröffentlicht das Repository Qwen/Qwen3.8-27B auf Hugging Face unter der Apache-2.0-Lizenz: ein dichtes Modell mit 27 Milliarden Parametern, nativen Bild-Sprach-Fähigkeiten und einem Kontextfenster von 262.144 Tokens. Die Ollama-Bibliothek führt noch am selben Tag den offiziellen Tag mit zwölf Varianten auf (Q4_K_M, Q8, BF16, MLX-Builds für Apple Silicon). Zwischen dem API-Start von Max und der Veröffentlichung der offenen Modellgewichte liegen somit elf Tage.
i
Warum diese zeitliche Verzögerung normal ist
Bei Alibaba wie auch bei anderen Anbietern erscheint das proprietäre Modell „Max“ zunächst über eine API, um damit Einnahmen zu erzielen und die Nutzung zu steuern. Die kleineren, dichten Open-Weight-Varianten folgen oft einige Wochen später, sobald die Flaggschiffversion stabilisiert ist. Eine Verzögerung zwischen der WAIC-Ankündigung und der Veröffentlichung der Modellgewichte ist nichts Ungewöhnliches.

#Was tatsächlich veröffentlicht wurde: Qwen 3.8-Max

Qwen 3.8-Max ist das einzige Modell dieser Generation, das heute tatsächlich verfügbar ist. Dabei muss klar sein: Es ist kein Modell, das Sie zu Hause betreiben können. Seine Größe schließt Self-Hosting für Privatanwender aus, und seine Gewichte sind ohnehin nicht veröffentlicht.

Architektur
Mixture-of-Experts-Modell mit insgesamt etwa 2,4 Billionen Parametern, von denen pro Token nur ein Teil aktiv ist. Es lässt sich nicht auf Hardware für Privatanwender laden, auch nicht auf sehr hochwertige Systeme.
Kontext
Angekündigtes Kontextfenster von 1 Million Tokens, ausgelegt auf lange Dokumente und vollständige Codebasen.
Verfügbarkeit
API von Alibaba Cloud (DashScope) und Qwen-Anwendung. Nutzungsabhängige Abrechnung, kein Download der Modellgewichte.
Positionierung
Direkter Konkurrent der führenden proprietären Modelle. Mit Cloud-Angeboten vergleichen, nicht mit lokalen Modellen.
!
„Auf dem lokalen Rechner“ gilt nicht für Max
Wenn ein Tutorial behauptet, Qwen 3.8-Max lasse sich mit Ollama auf einem PC installieren, seien Sie vorsichtig: Ein MoE mit mehreren Trillionen Parametern passt auf keinen Rechner für Privatanwender, und seine Gewichte werden nicht bereitgestellt. Lokal installierbar wird die dichte 27B-Variante sein – sobald sie erscheint.

#Offene Gewichte: Was versprochen wird und was geliefert wird

Die Einordnung ist nun einfach: Was auf der WAIC angekündigt wurde, wurde tatsächlich geliefert, mit elf Tagen Abstand zum API-Modell. Hier ist die sachliche Bilanz.

Versprochen
Ein dichtes Open-Weight-Modell Qwen3.8-27B unter einer permissiven Lizenz, das in quantisierter Form auf eine GPU mit 24 GB Speicher passen soll.
Geliefert
Genau das, am 14. August 2026: Modellgewichte im safetensors-Format auf Hugging Face, Apache-2.0-Lizenz, GGUF und MLX-Builds über Ollama verteilt, 18 GB in Q4_K_M – damit klar innerhalb der angestrebten 24 GB.
Zusätzlich
Die native Vision (Bilder und Videos) sowie ein Kontext von 262.144 Tokens, erweiterbar auf 1M über YaRN, was nicht in den ursprünglichen Ankündigungen garantiert war.
→
Eine skeptische Haltung gegenüber Hype bleibt sinnvoll
Bevor Sie davon ausgehen, dass ein Modell lokal verfügbar ist, hilft ein einfacher Test: Lassen sich die Modellgewichte jetzt mit einem Befehl und ohne Warteliste herunterladen? Zwischen dem 3. und dem 13. August 2026 bestand Qwen 3.8 diesen Test nicht, obwohl Dutzende Artikel es bereits als installierbar darstellten. Seit dem 14. August besteht es den Test.

#Die Veröffentlichung vom 14. August auf Hugging Face

Das offizielle Repository bleibt die verlässlichste Quelle für die Verfügbarkeit. Hier erfahren Sie, wie Sie selbst prüfen können – heute ebenso wie bei der nächsten Generation und auch, um die Angaben in diesem Artikel zu überprüfen, der seinerseits veralten wird.

Über die Hugging Face CLI überprüfen
pip install -U "huggingface_hub[cli]"

# Lister les dépôts de l'organisation Qwen contenant "3.8"
huggingface-cli repo list Qwen --limit 200 | grep -i "3.8"

# Depuis le 14/08/2026, la commande renvoie bien Qwen/Qwen3.8-27B

Das offizielle Repository ist Qwen/Qwen3.8-27B. Seine Modellkarte nennt 27 Milliarden Parameter, 64 Schichten, hybride Attention, native Bildverarbeitung und die Apache-2.0-Lizenz. Bei Ollama sind zwölf Varianten veröffentlicht, von Q4_K_M mit 18 GB bis BF16 mit 56 GB.

In Ollama prüfen
# Depuis le 14 août 2026, le tag officiel existe :
ollama pull qwen3.8:27b   # 18 Go (Q4_K_M)

# Variante Apple Silicon (Metal)
ollama pull qwen3.8:27b-mlx

#Sollte man von Qwen 3.6 wechseln?

Wenn Sie bereits Qwen 3.6-27B einsetzen, lautet die Frage nicht mehr „Was installiere ich in der Zwischenzeit?“, sondern „Lohnt sich der Download des Updates?“. Kurze Antwort: Ja, bei gleichem Speicherbedarf – behalten Sie aber das alte Modell, bis Sie Ihre Prompts erneut überprüft haben.

Qwen3.8-27B
Gleiche Größenordnung wie die 3.6-27B (24 GB VRAM in Q4), Lizenz Apache 2.0, native Bildverarbeitung, Kontext 262k. Die veröffentlichten Scores steigen vor allem beim agentischen Programmieren und bei der Computerbedienung.
Qwen 3.6-27B
Weiterhin eine gute Wahl: stabil, bewährt, hervorragend auf Französisch. Wenn Sie das Modell für Gespräche nutzen, müssen Sie nicht wechseln.
Qwen3-Coder-Next
Das auf Code spezialisierte Modell bleibt bei der Autovervollständigung schneller. Qwen 3.8 27B lohnt sich, wenn ein Agent mehrere Dateien lesen, Änderungen planen und die Dateien bearbeiten muss.

Eine schnelle Orientierung zum Speicherbedarf in Q4_K_M, um die Hardware richtig zu dimensionieren: Ein 14B-Modell benötigt etwa 9 GB VRAM, ein 27–32B-Modell etwa 19 GB und ein 70B-Modell etwa 40 GB. Für ein 27B-Modell in Q4 sollte man daher eine Karte mit 24 GB (RTX 4090, RTX 3090) oder einen Mac mit mindestens 24 GB gemeinsamem Arbeitsspeicher einplanen.

RTX 3060 12 GB
Gut geeignet für 8–14B-Modelle. Das 27B-Modell passt nicht vollständig hinein – Teile werden auf die CPU ausgelagert, was den Betrieb verlangsamt.
RTX 4090 / 3090 (24 GB)
Die ideale Wahl für ein 27–32B-Modell in Q4_K_M, vollständig auf der GPU.
Mac M4 Pro (24–48 GB vereinheitlichter Speicher)
Das 27B-Modell läuft dank des vereinheitlichten Speichers sehr gut; planen Sie für lange Kontexte mindestens 32 GB ein.

#Installieren: der kürzeste Weg

Die vollständige Installation – Quantisierungen, MLX-Variante auf dem Mac, Kontexteinstellungen, Thinking-Modus und Fehlerbehebung – wird in einem eigenen Leitfaden behandelt. Hier ist die Zusammenfassung in drei Befehlen.

  1. 01
    1. Ollama aktualisieren
    Die hybriden Schichten von Qwen 3.8 erfordern eine aktuelle Version der Engine. Eine Version von vor August 2026 gibt einen Architekturfehler zurück.
  2. 02
    2. Modell herunterladen
    18 GB in Q4_K_M, dem Standardformat. Bevorzugen Sie auf einem Mac mit Apple Silicon den Tag -mlx.
  3. 03
    3. Die Verteilung prüfen
    ollama ps indique si le modèle tourne entièrement sur le GPU. Tant que ce n'est pas 100 % GPU, le débit reste médiocre.
Terminal
# 1. Le daemon répond ?
curl http://localhost:11434/api/tags

# 2. Télécharger Qwen 3.8 27B (Q4_K_M, 18 Go)
ollama pull qwen3.8:27b

# 3. Premier chat
ollama run qwen3.8:27b "Explique en une phrase la différence entre un modèle MoE et un modèle dense."

# 4. Vérifier que tout est bien sur le GPU
ollama ps

Für reine Programmieraufgaben bleibt die spezialisierte Variante der vorherigen Generation relevant und ist weniger ressourcenintensiv.

Code-Variante
ollama pull qwen3-coder-next
ollama run qwen3-coder-next "Écris une fonction Python qui parse un fichier CSV et renvoie la somme d'une colonne."
→
Die Migration von Version 3.6 ist trivial
Sie bleiben in der Qwen-Familie: Ein „ollama pull qwen3.8:27b“ und eine Änderung des Modellnamens in Ihrer Konfiguration reichen aus. Ihre Prompts, Ihre Benutzeroberfläche und Ihre Skripte bleiben unverändert — nur die Sampling-Einstellungen sollten Sie noch einmal prüfen, da der Thinking-Modus in Version 3.8 standardmäßig aktiviert ist.

#Was man sich merken sollte

Die Episode rund um Qwen 3.8 ist ein Lehrbeispiel für die Verwechslung von Ankündigung, API-Veröffentlichung und Veröffentlichung der Modellgewichte. Hier sind die überprüften Fakten mit Datum.

Der Ollama-Tag
qwen3.8:27b, veröffentlicht am 14. August 2026, 18 GB in Q4_K_M. Insgesamt zwölf Varianten, darunter zwei MLX-Builds für Apple Silicon.
Die Lizenz
Apache 2.0: kommerzielle Nutzung, Änderung und Verteilung erlaubt, ohne Benutzergrenze oder nutzungsbeschränkende Klauseln.
Die veröffentlichten Modellgrößen
Derzeit gibt es nur eine Größe als dichtes Modell: 27B. Bis heute wurde keine kleinere Variante der Generation 3.8 veröffentlicht.
Die Benchmarkergebnisse
Die verfügbaren Ergebnisse stammen aus der offiziellen Modellkarte. Bisher wurde keine unabhängige Reproduktion veröffentlicht.
i
Zusammenfassung
Qwen 3.8-Max ist seit dem 3. August 2026 verfügbar (API, proprietär, nicht lokal ausführbar). Die offenen Gewichte von Qwen3.8-27B wurden am 14. August 2026 unter der Apache-2.0-Lizenz veröffentlicht und lassen sich mit einem einzigen Befehl installieren. Die vollständige Schritt-für-Schritt-Anleitung – VRAM, Quantisierungen, Kontext, Thinking-Modus – finden Sie im zugehörigen Installationsleitfaden.

#Weiterführende Informationen

Für den Übergang von der Chronologie zur Praxis führen diese Leitfäden den vorliegenden Leitfaden weiter:

Qwen 3.8 27B lokal
Die vollständige Installationsanleitung: Ollama-Befehl, VRAM je nach Quantisierung, MLX-Variante auf dem Mac, Fallstrick beim 256k-Kontext und Einstellungen des Thinking-Modus.
Ollama korrekt installieren
„Ollama installieren: Windows, macOS und Linux“ erläutert die RAM- und GPU-Voraussetzungen sowie das erste Modell, das Sie starten sollten, wenn Sie bei null anfangen.
Die richtige Quantisierung wählen
„Die Quantisierung wählen (Q4, Q5, Q8, FP16)“ erklärt den Kompromiss zwischen Qualität und Speicherbedarf – entscheidend, damit ein 27B-Modell in 24 GB Speicher passt.
Die GPU dimensionieren
„Die richtige GPU für lokale KI auswählen“ hilft Ihnen, den VRAM-Bedarf nicht zu unterschätzen, bevor Sie eine GPU für ein künftiges 27B-Modell kaufen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.