Mittelstufe 10 Min.Community

Qwythos 9B: das mit Claude trainierte kleine Reasoning-Modell im lokalen Test

Qwythos-9B ist ein Community-Modell, das Empero AI im Juni 2026 veröffentlicht hat: Es basiert auf Qwen3.5-9B unter der Apache-2.0-Lizenz, hat ein Kontextfenster von 1M und wurde mit von Claude generierten Denkabläufen feinabgestimmt – daher das Kofferwort „Qwythos“ (Qwen + Mythos). Dahinter steht keine Hochglanz-Marketingseite: nur GGUF-Gewichte auf Hugging Face und Ollama-Tags, die von der Community hochgeladen wurden. Dieser Leitfaden klärt die Herkunft, zeigt, wie sich das Modell sauber installieren lässt, und vergleicht es in einem Praxistest auf einer RTX 5070 Ti mit seinem Basismodell Qwen3.5-9B.

Von Mohamed Meguedmi·Aktualisierung 2026-08-21·Unter Windows, macOS und Linux getestet

#Qwythos, was ist das genau

Qwythos-9B ist kein „from scratch“, also von Grund auf trainiertes Modell. Es ist ein Fine-Tune: Jemand hat eine solide offene Basis – Qwen3.5-9B von Alibaba – genommen und sie auf einem spezifischen Korpus von dokumentierten Denkabläufen weitertrainiert. Diese Denkabläufe (detaillierte Gedankenketten, Frage → schrittweises Nachdenken → Antwort) sollen aus Ausgaben von Claude, der Modellfamilie von Anthropic, zu einer Sammlung von Logik-, Mathematik- und Programmieraufgaben stammen. Der Name „Qwythos“ fasst die Idee zusammen: der Anfangsbuchstabe von Qwen und „Mythos“, der informelle Name, den die Community, die den Datensatz zusammengestellt hat, dem Denkstil von Claude gegeben hat.

Der Reiz des Projekts lässt sich in einem Satz zusammenfassen: einen ausführlichen, strukturierten Denkstil in ein Modell zu destillieren, das klein genug ist, um auf einer handelsüblichen GPU zu laufen. Ein 9B-Modell passt in Q4 in 6 GB VRAM, während große Reasoning-Modelle mehrere Dutzend GB benötigen. Wenn sich die „Art zu denken“ erfolgreich übertragen lässt, erhält man ein Reasoning-Modell im Taschenformat. Genau das werden wir überprüfen.

i
Community-Modell, kein offizielles Produkt
Qwythos ist weder ein Alibaba-Modell noch ein Anthropic-Modell. Es ist ein von der Community erstelltes Fine-Tune, das von Empero AI vertrieben wird. Keines der beiden ursprünglichen Unternehmen pflegt es oder steht dafür ein. Behandeln Sie es wie ein Open-Source-Projekt: Die Gewichte sind vorhanden, die Qualität muss überprüft werden, und der Support hängt vom guten Willen seiner Autoren ab.

#Herkunft von Qwythos: die beiden Quellen, die Sie kennen sollten

Das Kit Lokale KI

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Bevor Sie irgendetwas installieren, müssen Sie verstehen, woher die Modellgewichte tatsächlich stammen. Bei einem Community-Modell ist die Herkunft keine Nebensache: Sie bestimmt, wie viel Vertrauen Sie der Datei schenken können, die Sie herunterladen. Qwythos ist an zwei Stellen zu finden, und diese sind nicht gleichwertig.

Quelle 1 — Hugging Face (Original-Repository)
Empero AI veröffentlicht die Gewichte auf Hugging Face, sowohl im transformers-Format (safetensors) als auch als quantisierte GGUF-Dateien. Das ist die maßgebliche Quelle: Modellkarte, angegebene Apache-2.0-Lizenz, Hinweise auf die Basis Qwen3.5-9B und den Datensatz mit Schlussfolgerungsspuren. Gehen Sie immer von dort aus, um den Hash zu überprüfen und die Modellkarte zu lesen.
Quelle 2 — Ollama-Tags aus der Community
In der Ollama-Registry erscheint Qwythos unter Benutzer-Namensräumen (etwa benutzername/qwythos), nicht in der offiziellen Bibliothek. Diese Tags sind praktisch – ein einziger Befehl zur Installation –, werden aber von Dritten aus den GGUF-Dateien auf Hugging Face neu verpackt. Prüfen Sie, wer den Tag veröffentlicht, bevor Sie ihm vertrauen.
!
Ein Ollama-Tag ist nicht signiert
Jeder kann unter seinem eigenen Namen ein Modell in der Ollama-Registry veröffentlichen. Ein Tag „qwythos“ garantiert nicht, dass die dahinterliegende GGUF-Datei den offiziellen Gewichten von Empero AI entspricht. Laden Sie für einen ernsthaften Einsatz die GGUF-Datei vorzugsweise von Hugging Face herunter und importieren Sie sie selbst über ein Modelfile (siehe unten), statt blind ein Modell über einen Community-Tag herunterzuladen.
Base
Qwen3.5-9B (Alibaba), Lizenz Apache 2.0
Typ
Für Schlussfolgerungen feinabgestimmtes Modell, explizite Gedankenkette
Herausgeber
Empero AI (Community-Projekt), veröffentlicht im Juni 2026
Lizenz
Apache 2.0 – kommerzielle Nutzung erlaubt, vom Basismodell übernommene Lizenz
Kontext
1 Mio. Tokens angekündigt (von Qwen3.5 übernommen), angesichts des tatsächlich verfügbaren VRAM mit Vorbehalt zu betrachten
Formate
safetensors + GGUF (Q4_K_M, Q5_K_M, Q8_0) auf Hugging Face

#Hardware-Voraussetzungen

Ein Modell mit 9 Milliarden Parametern lässt sich auf aktueller Hardware komfortabel betreiben. Mit der Quantisierung Q4_K_M – dem empfohlenen Kompromiss zwischen Qualität und Speicherbedarf – belegt Qwythos-9B nach dem Laden etwa 6 GB VRAM. Hinzu kommt der Kontext-Cache (KV-Cache), der mit der Länge der Prompts wächst. Unser Testsystem nutzt eine RTX 5070 Ti (16 GB) und liegt damit deutlich über den Mindestanforderungen.

Q4_K_M (empfohlen)
≈ 6 GB VRAM. Passt auf eine RTX 3060 mit 12 GB, eine 4070, eine 5070 Ti — und bei kurzem Kontext sogar teilweise in 8 GB.
Q5_K_M
≈ 7 GB. Geringer Qualitätsgewinn, bevorzugt bei 12 GB oder mehr.
Q8_0
≈ 10 GB. Fast ohne Verlust im Vergleich zu FP16, geeignet ab 16 GB und darüber.
Langer Kontext
Die angekündigte Kontextlänge von 1M Tokens ist theoretisch. Ein KV-Cache für 128k Tokens benötigt bereits mehrere GB zusätzlichen Speicher; streben Sie mindestens 16 GB VRAM an, um komfortabel über 32k Tokens hinauszugehen.
→
Ein Reasoning-Modell erzeugt viel
Reasoning-Modelle „denken“ laut nach, bevor sie antworten: Sie erzeugen manchmal mehrere hundert Tokens für ihre Überlegungen, obwohl die Antwort nur eine Zeile lang ist. Planen Sie ausreichend Spielraum im Ausgabekontext (num_predict) ein und rechnen Sie mit längeren Antwortzeiten als bei einem klassischen Modell gleicher Größe.

#Qwythos mit Ollama installieren

Zwei Wege. Der schnelle: ein Modell unter einem Community-Tag herunterladen. Der sichere: die offizielle GGUF-Datei von Hugging Face herunterladen und über ein Modelfile importieren. Ich erläutere beide Wege; für einen Rechner im ernsthaften Arbeitseinsatz ist der zweite vorzuziehen, weil Sie genau wissen, welche Datei Sie ausführen.

  1. 01
    Prüfen, ob Ollama läuft
    Ollama stellt seinen Daemon unter http://localhost:11434 bereit. Ein einfacher Aufruf bestätigt, dass er antwortet, bevor Sie fortfahren. Falls Sie Ollama noch nicht installiert haben, lesen Sie die Ollama-Installationsanleitung.
  2. 02
    Schneller Einstieg — Community-Tag
    Suchen Sie den Tag auf ollama.com (im Benutzernamensraum) und führen Sie anschließend ollama run aus. Notieren Sie den genauen Namen des Herausgebers: Das ist Ihre einzige Garantie für die Herkunft.
  3. 03
    Sicherer Weg — GGUF von Hugging Face
    Laden Sie die .gguf-Datei in Q4_K_M aus dem Repository von Empero AI herunter, gleichen Sie ihre SHA256-Prüfsumme mit der auf der Modellkarte angegebenen ab und erstellen Sie anschließend ein Modelfile, das auf diese Datei verweist.
  4. 04
    Das lokale Modell erstellen
    Der Befehl ollama create erstellt auf Grundlage Ihres Modelfile ein Modell mit einem Namen. Sie erhalten einen lokalen Tag, den Sie von Anfang bis Ende kontrollieren.
  5. 05
    Starten und chatten
    ollama run startet die interaktive Sitzung. Beim ersten Laden wird das Modell in den VRAM geladen; solange es dort verbleibt, erfolgen weitere Starts sofort.
Terminal — Ollama überprüfen
curl http://localhost:11434/api/version
# {"version":"0.x.x"}
Terminal – der schnelle Weg (Community-Tag)
# Remplacez <publieur> par le nom réel du dépôt Ollama
ollama run <publieur>/qwythos:9b-q4_k_m
Terminal – sichere Option (GGUF Hugging Face)
# 1. Télécharger le GGUF officiel depuis le dépôt Empero AI
huggingface-cli download EmperoAI/Qwythos-9B-GGUF \
  qwythos-9b-Q4_K_M.gguf --local-dir ./qwythos

# 2. Vérifier l'empreinte contre celle de la carte du modèle
sha256sum ./qwythos/qwythos-9b-Q4_K_M.gguf
Modelfile — qwythos.Modelfile
FROM ./qwythos/qwythos-9b-Q4_K_M.gguf

PARAMETER temperature 0.6
PARAMETER top_p 0.95
PARAMETER num_ctx 32768

# Encourage la chaîne de pensée explicite
SYSTEM """Tu es un assistant de raisonnement. Décompose chaque problème étape par étape avant de conclure."""
Terminal — importieren und starten
ollama create qwythos-9b -f qwythos.Modelfile
ollama run qwythos-9b
i
Niedrigere Temperatur für das Denken
Bei Reasoning-Modellen liefert eine Temperatur um 0,6 stabilere Gedankengänge als der übliche Wert von 0,8. Ist die Temperatur zu hoch, schweift das Modell ab; ist sie zu niedrig (0,1–0,2), wiederholt es sich. Die Kombination aus einer Temperatur von 0,6 und top_p von 0,95 ist ein guter Ausgangspunkt; passen Sie die Werte an Ihre Aufgaben an.

#Erster Test des logischen Denkens

Wir beginnen mit einer klassischen Aufgabe mit einer Falle, wie sie kleine Modelle, die nicht auf logisches Schlussfolgern trainiert wurden, ins Stolpern bringt. Das Ziel ist nicht nur, die richtige Antwort zu erhalten, sondern zu sehen, ob das Modell einen schlüssigen Lösungsweg entwickelt, statt zu raten.

Test-Prompt
ollama run qwythos-9b "Un batte et une balle coûtent 1,10 € au total. La batte coûte 1 € de plus que la balle. Combien coûte la balle ? Raisonne étape par étape."

Erwartete Antwort: 0,05 €. Die intuitive Falle verleitet zu 0,10 €. Auf unserem Prüfstand stellt Qwythos-9B die Gleichung auf (Ball = x, Schläger = x + 1, Summe 2x + 1 = 1,10), isoliert x = 0,05 und überprüft, dass 0,05 + 1,05 = 1,10, bevor es zu einem Ergebnis kommt. Das Vorgehen ist wortreich – etwa zehn Zeilen Gedankengang für eine Antwort aus einer einzigen Zahl –, aber korrekt und nachvollziehbar. Genau dieses Verhalten erhofft man sich von einem auf Reasoning feinabgestimmten Modell.

→
Testen Sie mit IHREN eigenen Problemen
Ein Modell könnte solchen klassischen Rätseln bereits während des Trainings begegnet sein. Für eine faire Beurteilung erstellen Sie zwei oder drei Aufgaben aus Ihrem tatsächlichen Arbeitsbereich (eine logistische Einschränkung, einen Codeabschnitt zum Debuggen, eine betriebliche Berechnung) und vergleichen Sie die Vorgehensweise, nicht nur das Endergebnis.

#Qwythos im Vergleich zum Basismodell Qwen3.5-9B: Was das Fine-Tuning verändert

Die eigentliche Frage: Bietet das feinabgestimmte Modell einen Mehrwert gegenüber dem Basismodell, aus dem es hervorgegangen ist? Um das zu messen, installieren wir das Basismodell Qwen3.5-9B parallel und stellen beiden Modellen dieselbe Reihe von Logik- und Mathematikaufgaben bei gleicher Temperatur. Das sind die Ergebnisse auf unserem Testsystem mit RTX 5070 Ti.

Terminal — die Basis für den Vergleich installieren
ollama pull qwen3.5:9b
ollama run qwen3.5:9b "Un batte et une balle coûtent 1,10 €..."
Reflexionslänge
Qwythos legt konsequent eine explizite Gedankenkette dar; das Basismodell Qwen3.5 antwortet häufig kürzer, manchmal direkt, ohne die Zwischenschritte zu zeigen.
Aufgaben mit Fallstricken
Bei kontraintuitiven Rätseln (Schläger/Ball, logische Folgen) macht Qwythos weniger Fehler, weil es seine Antwort überprüft. Das Basismodell tappt leichter in die Falle der intuitiven Antwort.
Geschwindigkeit
Vorteil für das Basismodell: Es erzeugt weniger Tokens für eine gleichwertige Antwort. Qwythos ist in der Praxis langsamer, weil es vor der Antwort „denkt“ – der Preis des Schlussfolgerns.
Reines Faktenwissen
Unentschieden. Das Fine-Tuning für logisches Schlussfolgern fügt kein Faktenwissen hinzu; bei Fragen zum Allgemeinwissen sind beide Modelle gleichwertig (und weisen dieselben Wissenslücken auf).
Französisch
Gleichwertig. Die Qualität des Französischen stammt vom Basismodell Qwen3.5; Qwythos verbessert oder verschlechtert den Sprachfluss nicht, sondern verändert die Struktur der Antwort, nicht die Sprache.

Fazit des Vergleichs: Qwythos gewinnt klar bei Aufgaben, bei denen der Lösungsweg zählt (Mathematik, Logik, Debugging, Planung), verliert aber bei Geschwindigkeit und kurzen Antworten. Wenn Sie einen schnellen Assistenten für Umformulierungen oder Zusammenfassungen möchten, reicht das Basismodell Qwen3.5-9B aus. Wenn Sie ein kleines Reasoning-Modell möchten, das seinen Lösungsweg zeigt, hat Qwythos seine Berechtigung.

!
Das Denken ist nicht kostenlos
Gedankenkette = mehr generierte Tokens = höhere Latenz und mehr VRAM-Verbrauch für den Kontext. Bei einfachen Aufgaben verlangsamt es die Verarbeitung, ein Modell zum Schlussfolgern zu zwingen, ohne einen Nutzen zu bringen. Setzen Sie Qwythos nur für Probleme ein, die tatsächlich von einer Zerlegung in Teilschritte profitieren, und verwenden Sie für den Rest ein direkteres Modell.

#Der große Bruder: Qwythos 27B

Empero AI veröffentlicht auch eine 27B-Variante, die auf einer größeren Qwen3.5-Basis nach demselben Prinzip aufbaut: Fine-Tuning anhand von aufgezeichneten Schlussfolgerungsprozessen. Sie richtet sich an Nutzer, die genügend VRAM haben, um die Qualität des Schlussfolgerns weiter zu steigern, allerdings bei einem deutlich höheren Speicherbedarf.

VRAM (Q4_K_M)
≈ 19 GB. Damit das Modell mit ausreichend Speicherreserve Platz findet, braucht man eine RTX 4090 mit 24 GB, eine professionelle Grafikkarte oder einen Mac mit vereinheitlichtem Speicher (M4 Pro/Max).
Was man gewinnt
Längere und robustere Argumentationsketten bei mehrstufigen Problemen; weniger sich fortsetzende Rechenfehler. Der Abstand wächst vor allem bei wirklich schwierigen Aufgaben.
Was man dafür in Kauf nimmt
Dreimal so viel VRAM und eine langsamere Generierung. Auf Hardware mit 12–16 GB passt das 27B-Modell in Q4 schlicht nicht in den GPU-Speicher, ohne Teile auf die CPU auszulagern, was die Geschwindigkeit stark drückt.
Wann diese Wahl sinnvoll ist
Wenn das 9B-Modell regelmäßig an Ihren tatsächlichen Problemen scheitert UND Sie 24 GB VRAM haben. Andernfalls bietet das 9B-Modell weiterhin das beste Verhältnis zwischen Qualität und Ressourcenbedarf.
i
Beginnen Sie mit dem 9B
Greifen Sie nicht reflexartig zum 27B. Testen Sie zunächst den 9B mit Ihren tatsächlichen Aufgaben: In vielen Fällen reicht er aus. Wechseln Sie nur dann zum 27B, wenn Sie bei Problemen, die Sie tatsächlich lösen müssen, an eine konkrete Qualitätsgrenze stoßen – nicht aus Prinzip.

#Fehlerbehebung

Der Ollama-Tag existiert nicht / ist verschwunden
Community-Tags kommen und gehen. Wählen Sie den zuverlässigen Weg: Laden Sie die GGUF-Datei von Hugging Face herunter und importieren Sie sie über ein Modelfile. So sind Sie nicht mehr von der Verfügbarkeit eines Drittanbieters abhängig.
Das Modell denkt nicht nach, es antwortet knapp
Fügen Sie eine explizite Systemanweisung hinzu („zerlege die Aufgabe Schritt für Schritt“) und prüfen Sie, ob num_ctx groß genug ist, um Platz für das Nachdenken zu lassen. Eine zu niedrige Temperatur unterdrückt ebenfalls die Gedankenkette.
Abgeschnittene Antworten
Das Nachdenken verbraucht das Ausgabebudget. Erhöhen Sie num_predict (oder den entsprechenden Parameter Ihres Clients), damit das Modell seinen Gedankengang abschließen UND seine Antwort geben kann.
Sehr langsame Ausgabe
Prüfen Sie, ob das Modell vollständig in den VRAM passt (ollama ps). Wenn Teile in den Arbeitsspeicher ausgelagert werden, bricht die Geschwindigkeit ein: Wählen Sie eine Quantisierung mit einer niedrigeren Bitzahl oder reduzieren Sie num_ctx.
Zweifel an der Integrität der Datei
Vergleichen Sie die SHA256-Prüfsumme der heruntergeladenen GGUF-Datei mit der auf der Hugging-Face-Modellkarte veröffentlichten. Eine abweichende Prüfsumme bedeutet, dass die Datei neu verpackt oder beschädigt ist – führen Sie sie nicht aus.

#Weiterführende Informationen

Um die Komponenten rund um Qwythos zu installieren und die hier angesprochenen Abwägungen zu verstehen:

Ollama installieren (Windows, macOS, Linux)
Voraussetzung für diesen Leitfaden: den Ollama-Daemon auf Port 11434 einrichten, bevor Sie überhaupt ein Modell herunterladen.
Quantisierung wählen (Q4, Q5, Q8, FP16)
Um je nach verfügbarem VRAM und Ihren Qualitätsanforderungen zwischen Q4_K_M, Q5_K_M und Q8_0 zu wählen – sowohl für Qwythos als auch für seine Geschwistermodelle.
DeepSeek R1 mit Ollama installieren
Ein weiteres Open-Source-Reasoning-Modell mit Gedankenkette, das sich eignet, um die Vorgehensweise von Qwythos mit einer fest etablierten Referenz zu vergleichen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.