Qwythos 9B: das mit Claude trainierte kleine Reasoning-Modell im lokalen Test
Qwythos-9B ist ein Community-Modell, das Empero AI im Juni 2026 veröffentlicht hat: Es basiert auf Qwen3.5-9B unter der Apache-2.0-Lizenz, hat ein Kontextfenster von 1M und wurde mit von Claude generierten Denkabläufen feinabgestimmt – daher das Kofferwort „Qwythos“ (Qwen + Mythos). Dahinter steht keine Hochglanz-Marketingseite: nur GGUF-Gewichte auf Hugging Face und Ollama-Tags, die von der Community hochgeladen wurden. Dieser Leitfaden klärt die Herkunft, zeigt, wie sich das Modell sauber installieren lässt, und vergleicht es in einem Praxistest auf einer RTX 5070 Ti mit seinem Basismodell Qwen3.5-9B.
#Qwythos, was ist das genau
Qwythos-9B ist kein „from scratch“, also von Grund auf trainiertes Modell. Es ist ein Fine-Tune: Jemand hat eine solide offene Basis – Qwen3.5-9B von Alibaba – genommen und sie auf einem spezifischen Korpus von dokumentierten Denkabläufen weitertrainiert. Diese Denkabläufe (detaillierte Gedankenketten, Frage → schrittweises Nachdenken → Antwort) sollen aus Ausgaben von Claude, der Modellfamilie von Anthropic, zu einer Sammlung von Logik-, Mathematik- und Programmieraufgaben stammen. Der Name „Qwythos“ fasst die Idee zusammen: der Anfangsbuchstabe von Qwen und „Mythos“, der informelle Name, den die Community, die den Datensatz zusammengestellt hat, dem Denkstil von Claude gegeben hat.
Der Reiz des Projekts lässt sich in einem Satz zusammenfassen: einen ausführlichen, strukturierten Denkstil in ein Modell zu destillieren, das klein genug ist, um auf einer handelsüblichen GPU zu laufen. Ein 9B-Modell passt in Q4 in 6 GB VRAM, während große Reasoning-Modelle mehrere Dutzend GB benötigen. Wenn sich die „Art zu denken“ erfolgreich übertragen lässt, erhält man ein Reasoning-Modell im Taschenformat. Genau das werden wir überprüfen.
#Herkunft von Qwythos: die beiden Quellen, die Sie kennen sollten
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
Bevor Sie irgendetwas installieren, müssen Sie verstehen, woher die Modellgewichte tatsächlich stammen. Bei einem Community-Modell ist die Herkunft keine Nebensache: Sie bestimmt, wie viel Vertrauen Sie der Datei schenken können, die Sie herunterladen. Qwythos ist an zwei Stellen zu finden, und diese sind nicht gleichwertig.
- Quelle 1 — Hugging Face (Original-Repository)
- Empero AI veröffentlicht die Gewichte auf Hugging Face, sowohl im transformers-Format (safetensors) als auch als quantisierte GGUF-Dateien. Das ist die maßgebliche Quelle: Modellkarte, angegebene Apache-2.0-Lizenz, Hinweise auf die Basis Qwen3.5-9B und den Datensatz mit Schlussfolgerungsspuren. Gehen Sie immer von dort aus, um den Hash zu überprüfen und die Modellkarte zu lesen.
- Quelle 2 — Ollama-Tags aus der Community
- In der Ollama-Registry erscheint Qwythos unter Benutzer-Namensräumen (etwa benutzername/qwythos), nicht in der offiziellen Bibliothek. Diese Tags sind praktisch – ein einziger Befehl zur Installation –, werden aber von Dritten aus den GGUF-Dateien auf Hugging Face neu verpackt. Prüfen Sie, wer den Tag veröffentlicht, bevor Sie ihm vertrauen.
- Base
- Qwen3.5-9B (Alibaba), Lizenz Apache 2.0
- Typ
- Für Schlussfolgerungen feinabgestimmtes Modell, explizite Gedankenkette
- Herausgeber
- Empero AI (Community-Projekt), veröffentlicht im Juni 2026
- Lizenz
- Apache 2.0 – kommerzielle Nutzung erlaubt, vom Basismodell übernommene Lizenz
- Kontext
- 1 Mio. Tokens angekündigt (von Qwen3.5 übernommen), angesichts des tatsächlich verfügbaren VRAM mit Vorbehalt zu betrachten
- Formate
- safetensors + GGUF (Q4_K_M, Q5_K_M, Q8_0) auf Hugging Face
#Hardware-Voraussetzungen
Ein Modell mit 9 Milliarden Parametern lässt sich auf aktueller Hardware komfortabel betreiben. Mit der Quantisierung Q4_K_M – dem empfohlenen Kompromiss zwischen Qualität und Speicherbedarf – belegt Qwythos-9B nach dem Laden etwa 6 GB VRAM. Hinzu kommt der Kontext-Cache (KV-Cache), der mit der Länge der Prompts wächst. Unser Testsystem nutzt eine RTX 5070 Ti (16 GB) und liegt damit deutlich über den Mindestanforderungen.
- Q4_K_M (empfohlen)
- ≈ 6 GB VRAM. Passt auf eine RTX 3060 mit 12 GB, eine 4070, eine 5070 Ti — und bei kurzem Kontext sogar teilweise in 8 GB.
- Q5_K_M
- ≈ 7 GB. Geringer Qualitätsgewinn, bevorzugt bei 12 GB oder mehr.
- Q8_0
- ≈ 10 GB. Fast ohne Verlust im Vergleich zu FP16, geeignet ab 16 GB und darüber.
- Langer Kontext
- Die angekündigte Kontextlänge von 1M Tokens ist theoretisch. Ein KV-Cache für 128k Tokens benötigt bereits mehrere GB zusätzlichen Speicher; streben Sie mindestens 16 GB VRAM an, um komfortabel über 32k Tokens hinauszugehen.
#Qwythos mit Ollama installieren
Zwei Wege. Der schnelle: ein Modell unter einem Community-Tag herunterladen. Der sichere: die offizielle GGUF-Datei von Hugging Face herunterladen und über ein Modelfile importieren. Ich erläutere beide Wege; für einen Rechner im ernsthaften Arbeitseinsatz ist der zweite vorzuziehen, weil Sie genau wissen, welche Datei Sie ausführen.
- 01Prüfen, ob Ollama läuftOllama stellt seinen Daemon unter http://localhost:11434 bereit. Ein einfacher Aufruf bestätigt, dass er antwortet, bevor Sie fortfahren. Falls Sie Ollama noch nicht installiert haben, lesen Sie die Ollama-Installationsanleitung.
- 02Schneller Einstieg — Community-TagSuchen Sie den Tag auf ollama.com (im Benutzernamensraum) und führen Sie anschließend ollama run aus. Notieren Sie den genauen Namen des Herausgebers: Das ist Ihre einzige Garantie für die Herkunft.
- 03Sicherer Weg — GGUF von Hugging FaceLaden Sie die .gguf-Datei in Q4_K_M aus dem Repository von Empero AI herunter, gleichen Sie ihre SHA256-Prüfsumme mit der auf der Modellkarte angegebenen ab und erstellen Sie anschließend ein Modelfile, das auf diese Datei verweist.
- 04Das lokale Modell erstellenDer Befehl ollama create erstellt auf Grundlage Ihres Modelfile ein Modell mit einem Namen. Sie erhalten einen lokalen Tag, den Sie von Anfang bis Ende kontrollieren.
- 05Starten und chattenollama run startet die interaktive Sitzung. Beim ersten Laden wird das Modell in den VRAM geladen; solange es dort verbleibt, erfolgen weitere Starts sofort.
#Erster Test des logischen Denkens
Wir beginnen mit einer klassischen Aufgabe mit einer Falle, wie sie kleine Modelle, die nicht auf logisches Schlussfolgern trainiert wurden, ins Stolpern bringt. Das Ziel ist nicht nur, die richtige Antwort zu erhalten, sondern zu sehen, ob das Modell einen schlüssigen Lösungsweg entwickelt, statt zu raten.
Erwartete Antwort: 0,05 €. Die intuitive Falle verleitet zu 0,10 €. Auf unserem Prüfstand stellt Qwythos-9B die Gleichung auf (Ball = x, Schläger = x + 1, Summe 2x + 1 = 1,10), isoliert x = 0,05 und überprüft, dass 0,05 + 1,05 = 1,10, bevor es zu einem Ergebnis kommt. Das Vorgehen ist wortreich – etwa zehn Zeilen Gedankengang für eine Antwort aus einer einzigen Zahl –, aber korrekt und nachvollziehbar. Genau dieses Verhalten erhofft man sich von einem auf Reasoning feinabgestimmten Modell.
#Qwythos im Vergleich zum Basismodell Qwen3.5-9B: Was das Fine-Tuning verändert
Die eigentliche Frage: Bietet das feinabgestimmte Modell einen Mehrwert gegenüber dem Basismodell, aus dem es hervorgegangen ist? Um das zu messen, installieren wir das Basismodell Qwen3.5-9B parallel und stellen beiden Modellen dieselbe Reihe von Logik- und Mathematikaufgaben bei gleicher Temperatur. Das sind die Ergebnisse auf unserem Testsystem mit RTX 5070 Ti.
- Reflexionslänge
- Qwythos legt konsequent eine explizite Gedankenkette dar; das Basismodell Qwen3.5 antwortet häufig kürzer, manchmal direkt, ohne die Zwischenschritte zu zeigen.
- Aufgaben mit Fallstricken
- Bei kontraintuitiven Rätseln (Schläger/Ball, logische Folgen) macht Qwythos weniger Fehler, weil es seine Antwort überprüft. Das Basismodell tappt leichter in die Falle der intuitiven Antwort.
- Geschwindigkeit
- Vorteil für das Basismodell: Es erzeugt weniger Tokens für eine gleichwertige Antwort. Qwythos ist in der Praxis langsamer, weil es vor der Antwort „denkt“ – der Preis des Schlussfolgerns.
- Reines Faktenwissen
- Unentschieden. Das Fine-Tuning für logisches Schlussfolgern fügt kein Faktenwissen hinzu; bei Fragen zum Allgemeinwissen sind beide Modelle gleichwertig (und weisen dieselben Wissenslücken auf).
- Französisch
- Gleichwertig. Die Qualität des Französischen stammt vom Basismodell Qwen3.5; Qwythos verbessert oder verschlechtert den Sprachfluss nicht, sondern verändert die Struktur der Antwort, nicht die Sprache.
Fazit des Vergleichs: Qwythos gewinnt klar bei Aufgaben, bei denen der Lösungsweg zählt (Mathematik, Logik, Debugging, Planung), verliert aber bei Geschwindigkeit und kurzen Antworten. Wenn Sie einen schnellen Assistenten für Umformulierungen oder Zusammenfassungen möchten, reicht das Basismodell Qwen3.5-9B aus. Wenn Sie ein kleines Reasoning-Modell möchten, das seinen Lösungsweg zeigt, hat Qwythos seine Berechtigung.
#Der große Bruder: Qwythos 27B
Empero AI veröffentlicht auch eine 27B-Variante, die auf einer größeren Qwen3.5-Basis nach demselben Prinzip aufbaut: Fine-Tuning anhand von aufgezeichneten Schlussfolgerungsprozessen. Sie richtet sich an Nutzer, die genügend VRAM haben, um die Qualität des Schlussfolgerns weiter zu steigern, allerdings bei einem deutlich höheren Speicherbedarf.
- VRAM (Q4_K_M)
- ≈ 19 GB. Damit das Modell mit ausreichend Speicherreserve Platz findet, braucht man eine RTX 4090 mit 24 GB, eine professionelle Grafikkarte oder einen Mac mit vereinheitlichtem Speicher (M4 Pro/Max).
- Was man gewinnt
- Längere und robustere Argumentationsketten bei mehrstufigen Problemen; weniger sich fortsetzende Rechenfehler. Der Abstand wächst vor allem bei wirklich schwierigen Aufgaben.
- Was man dafür in Kauf nimmt
- Dreimal so viel VRAM und eine langsamere Generierung. Auf Hardware mit 12–16 GB passt das 27B-Modell in Q4 schlicht nicht in den GPU-Speicher, ohne Teile auf die CPU auszulagern, was die Geschwindigkeit stark drückt.
- Wann diese Wahl sinnvoll ist
- Wenn das 9B-Modell regelmäßig an Ihren tatsächlichen Problemen scheitert UND Sie 24 GB VRAM haben. Andernfalls bietet das 9B-Modell weiterhin das beste Verhältnis zwischen Qualität und Ressourcenbedarf.
#Fehlerbehebung
- Der Ollama-Tag existiert nicht / ist verschwunden
- Community-Tags kommen und gehen. Wählen Sie den zuverlässigen Weg: Laden Sie die GGUF-Datei von Hugging Face herunter und importieren Sie sie über ein Modelfile. So sind Sie nicht mehr von der Verfügbarkeit eines Drittanbieters abhängig.
- Das Modell denkt nicht nach, es antwortet knapp
- Fügen Sie eine explizite Systemanweisung hinzu („zerlege die Aufgabe Schritt für Schritt“) und prüfen Sie, ob num_ctx groß genug ist, um Platz für das Nachdenken zu lassen. Eine zu niedrige Temperatur unterdrückt ebenfalls die Gedankenkette.
- Abgeschnittene Antworten
- Das Nachdenken verbraucht das Ausgabebudget. Erhöhen Sie num_predict (oder den entsprechenden Parameter Ihres Clients), damit das Modell seinen Gedankengang abschließen UND seine Antwort geben kann.
- Sehr langsame Ausgabe
- Prüfen Sie, ob das Modell vollständig in den VRAM passt (ollama ps). Wenn Teile in den Arbeitsspeicher ausgelagert werden, bricht die Geschwindigkeit ein: Wählen Sie eine Quantisierung mit einer niedrigeren Bitzahl oder reduzieren Sie num_ctx.
- Zweifel an der Integrität der Datei
- Vergleichen Sie die SHA256-Prüfsumme der heruntergeladenen GGUF-Datei mit der auf der Hugging-Face-Modellkarte veröffentlichten. Eine abweichende Prüfsumme bedeutet, dass die Datei neu verpackt oder beschädigt ist – führen Sie sie nicht aus.
#Weiterführende Informationen
Um die Komponenten rund um Qwythos zu installieren und die hier angesprochenen Abwägungen zu verstehen:
- Ollama installieren (Windows, macOS, Linux)
- Voraussetzung für diesen Leitfaden: den Ollama-Daemon auf Port 11434 einrichten, bevor Sie überhaupt ein Modell herunterladen.
- Quantisierung wählen (Q4, Q5, Q8, FP16)
- Um je nach verfügbarem VRAM und Ihren Qualitätsanforderungen zwischen Q4_K_M, Q5_K_M und Q8_0 zu wählen – sowohl für Qwythos als auch für seine Geschwistermodelle.
- DeepSeek R1 mit Ollama installieren
- Ein weiteres Open-Source-Reasoning-Modell mit Gedankenkette, das sich eignet, um die Vorgehensweise von Qwythos mit einer fest etablierten Referenz zu vergleichen.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.