Destillation: Wie kleine Modelle von den gros
Sie sind wahrscheinlich schon auf Namen wie DeepSeek-R1-Distill-Qwen-14B gestoßen und haben sich gefragt, warum ein „kleines“ Modell plötzlich fast so gut schlussfolgern kann wie ein riesiges. Die Antwort lässt sich in einem Wort zusammenfassen: Destillation. Diese Technik ermöglicht es einem kompakten Modell, das Verhalten eines viel größeren Modells zu übernehmen, ohne dessen Größe oder Langsamkeit zu haben. Dieser Leitfaden erklärt die LLM-Destillation anhand des Bildes von Lehrer und Schüler, erläutert, was tatsächlich übertragen wird und was dabei auf der Strecke bleibt, und zeigt, wie Sie eine gelungene Destillation erkennen, bevor Sie das destillierte Modell bei sich zu Hause ausführen.
#Das Problem, das die Destillation löst
Die besten offenen Modelle sind riesig: mehrere hundert Milliarden Parameter. Sie sind brillant, aber auf einem handelsüblichen Rechner nicht nutzbar: Sie benötigen mehrere zehn Gigabyte VRAM und erzeugen Text nur langsam. Umgekehrt passt ein 7B- oder 14B-Modell auf eine Gaming-Grafikkarte und antwortet schnell, doch ihm fehlt oft die Fähigkeit seines großen Bruders, differenziert zu schlussfolgern.
Man möchte also einen Teil der Fähigkeiten eines großen Modells in ein Format übertragen, das lokal läuft. Der naive Ansatz wäre, ein kleines Modell einfach erneut mit denselben Rohdaten wie das große zu trainieren. Das reicht nicht: Wenn ein kleineres Modell allein aus einem Meer von Text lernt, wird es zwar brauchbar, aber nicht außergewöhnlich. Die Destillation bietet eine Abkürzung: Statt die Welt von Grund auf neu kennenzulernen, lernt das kleine Modell direkt vom großen.
#Das Lehrer-Schüler-Prinzip
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Bei der Distillation kommen zwei Modelle zum Einsatz. Der „Lehrer“ ist das große, sehr leistungsfähige Modell, das man nachahmen möchte. Der „Schüler“ ist das kleine Modell, das trainiert wird. Das Prinzip: Man stellt dem Lehrer Tausende von Fragen, sammelt seine Antworten und trainiert den Schüler darauf, dieselben Antworten zu erzeugen. Der Schüler lernt nicht mehr anhand von unbearbeiteten Texten aus dem Web, sondern anhand von Beispielen, die ein Expertenmodell bereits „vorgekaut“ hat.
Der entscheidende Unterschied liegt darin, was der Schüler genau kopiert. In der umfassendsten Variante ahmt er nicht nur das vom Lehrer gewählte endgültige Wort nach, sondern die gesamte Wahrscheinlichkeitsverteilung für das nächste Wort: Der Lehrer sagt nicht einfach „Die Antwort ist Katze“, sondern gibt an: „Katze sehr wahrscheinlich, Hund etwas wahrscheinlich, Toaster nahezu unmöglich“. Diese Nuancen – manchmal als Soft Labels bezeichnet – enthalten Informationen, die die richtige Antwort allein nicht liefert.
- Lehrer (teacher)
- Das große Referenzmodell, teuer, aber hervorragend. Es dient als Quelle und wird nicht bei Ihnen bereitgestellt.
- Schüler (student)
- Das kleine Modell, das darauf trainiert wird, das Verhalten des Lehrers nachzubilden. Dieses Modell werden Sie lokal ausführen.
- Soft labels
- Die differenzierten Wahrscheinlichkeiten des Lehrermodells für jedes mögliche Wort, nicht nur für das Wort mit der höchsten Wahrscheinlichkeit. Das reichhaltigste Ausgangsmaterial für die Destillation.
- Distillationsdatensatz
- Die Gesamtheit der gestellten Fragen und der Antworten des Lehrers, mit der der Schüler trainiert.
#Was tatsächlich übertragen wird
Oft wird angenommen, dass die Destillation „das Wissen“ des großen Modells überträgt. Das stimmt teilweise, ist aber ungenau. Am besten lassen sich vor allem Verhaltensweisen und Vorgehensweisen übertragen, eher als reine Fakten. Ein kleines Modell hat eine begrenzte Speicherkapazität: Es kann sich nicht alles aus der internen Enzyklopädie eines riesigen Modells merken. Methoden hingegen kann es sehr gut übernehmen.
- Der Denkstil
- Die Art und Weise, ein Problem in Schritte zu zerlegen und eine Gedankenkette vor der Schlussfolgerung aufzubauen. Das wird am besten übertragen und ist das Herzstück von R1-Distill.
- Format der Antworten
- Die Struktur, der Ton, die Art und Weise, eine Erklärung oder Code zu organisieren. Der Schüler übernimmt die Schreibgewohnheiten des Lehrers.
- Die Lösungsansätze
- Bei Mathematik, Programmierung oder Logik übernimmt der Schüler bewährte Lösungswege: wie man an einen bestimmten Problemtyp herangeht und welche Prüfungen man durchführt.
- Ein Teil der Kenntnisse
- Fakten und Zusammenhänge, ja, aber nur im Rahmen der Kapazität des kleinen Modells. Dieser Bereich lässt sich am schlechtesten übertragen.
Diese Unterscheidung ist entscheidend, um neuere destillierte Modelle zu verstehen. Wenn DeepSeek R1 in ein Qwen-14B-Modell destilliert, geht es nicht darum, das gesamte Allgemeinwissen von R1 in 14 Milliarden Parametern unterzubringen – das ist unmöglich. Ziel ist es, dessen Art zu schlussfolgern zu übertragen: Schritt für Schritt nachzudenken, sich zu korrigieren und einen Beweis auszuführen. Und das kann ein kleines Modell bemerkenswert gut lernen.
#Warum ein destilliertes 14B-Modell ein klassisches 14B-Modell schlägt
Hier kommt der Punkt, der der Intuition widerspricht. Zwei Modelle sind genau gleich groß – 14 Milliarden Parameter – und haben daher denselben VRAM-Bedarf und dieselbe Geschwindigkeit. Trotzdem ist das destillierte Modell dem klassischen beim logischen Schlussfolgern oft deutlich überlegen. Die Größe hat sich nicht verändert; nur die Trainingsmethode hat sich geändert. Wie kann dieselbe Anzahl an Parametern ein viel besseres Modell ergeben?
Weil das Training die Parameter nicht zufällig befüllt, sondern organisiert. Ein klassisches 14B-Modell lernt allein aus Rohtext; es entwickelt brauchbare, aber generalistische Fähigkeiten. Ein destilliertes 14B-Modell lernt anhand von Beispielen, die von einem erstklassigen Lehrermodell erzeugt wurden, oft mit vollständig ausgeführten Gedankengängen. Seine 14 Milliarden Parameter vernetzen sich rund um gute Methoden, statt von allem ein bisschen abzubilden. Bei gleicher Kapazität macht die Qualität des Trainingssignals den Unterschied.
- Gleiche Kosten, besseres Signal
- Das destillierte Modell ist weder größer noch langsamer, hat aber anhand von Material deutlich höherer Qualität gelernt: den Ausgaben eines Experten.
- Informationsreiche Beispiele
- Die Antworten des Lehrermodells enthalten zahlreiche korrekte und vollständige Gedankengänge, die im Rohtext des Webs selten vorkommen.
- Weniger Rauschen
- Das Web enthält viele Fehler und viel Durcheinander. Ein Lehrer filtert die Inhalte: Der Schüler lernt anhand bereinigter Inhalte.
Achten Sie darauf, nicht zu viel hineinzuinterpretieren: „Schlagen“ gilt vor allem für die Aufgaben, auf die die Destillation abzielt, typischerweise logisches Denken, Mathematik und Code. Bei reinem Allgemeinwissen oder detailliertem Faktenwissen wird der Abstand kleiner oder kehrt sich sogar um. Ein destilliertes Modell ist nicht auf magische Weise in allem überlegen – es ist dort überlegen, wo es darauf trainiert wurde.
#Der Fall der R1-Distill-Modelle
Das Beispiel, das die Distillation für den lokalen Einsatz populär gemacht hat, ist die Anfang 2025 veröffentlichte DeepSeek-R1-Distill-Familie. DeepSeek nahm sein großes Reasoning-Modell R1 als Lehrer und destillierte dessen Verhalten in mehrere Schülermodelle unterschiedlicher Größe, die auf bestehenden Architekturen wie Qwen und Llama basieren. Das Ergebnis: Modelle mit 1,5B, 7B, 8B, 14B und 32B, die mit einer sichtbaren Gedankenkette schlussfolgern – etwas, das zuvor den größten Modellen vorbehalten war.
- R1-Distill-Qwen-1.5B
- Winzig, läuft praktisch überall, auch ohne GPU. Für seine Größe erstaunlich gut bei einfachen mathematischen Aufgaben.
- R1-Distill-Qwen-7B / Llama-8B
- Der Kompromiss für den breiten Einsatz: ~5 GB in Q4 auf einer Grafikkarte mit 8 GB. Gute Reasoning-Fähigkeiten für den täglichen Gebrauch.
- R1-Distill-Qwen-14B
- ≈ 9 GB in Q4, passend für eine RTX 3060 mit 12 GB oder eine RTX 4070 mit 12 GB. Der ideale Kompromiss zwischen Reasoning-Leistung und erschwinglicher Hardware.
- R1-Distill-Qwen-32B
- ≈ 19 GB in Q4, für eine RTX 4090 mit 24 GB. Dem Lehrermodell am nächsten, sofern Ihr VRAM ausreicht.
Diese Modelle zeigen ihre Gedankenkette zwischen Denk-Tags, bevor sie die endgültige Antwort geben. Genau dieses Verhalten wurde vom Lehrermodell R1 übernommen. In der Praxis entwickelt ein R1-Distill-Qwen-14B bei einer Mathematikaufgabe einen strukturierten Gedankengang, während ein klassisches Qwen 14B eher schlicht antworten würde — bei gleichem Speicherbedarf.
#Grenzen: Das, was nicht übertragen wird
Die Größe des Schülermodells setzt der Destillation eine Obergrenze. Den Ozean eines Riesen kann man nicht in einen Fingerhut gießen. Wer versteht, was dabei auf der Strecke bleibt, vermeidet Enttäuschungen und eine falsche Modellwahl.
- Detailliertes Faktenwissen
- Das kleine Modell kann sich nicht alles merken, was das Lehrermodell weiß. Bei sehr speziellen Fakten oder Nischenwissen halluziniert es leichter.
- Robustheit bei Aufgaben außerhalb des destillierten Themenbereichs
- Bei Aufgaben, die deutlich von dem abweichen, was durch Destillation vermittelt wurde, fällt das Schülermodell ungefähr auf das Niveau eines herkömmlichen Modells gleicher Größe zurück.
- Die Kapazitätsbegrenzung
- Ein destilliertes 7B-Modell bleibt ein 7B-Modell. Die Destillation optimiert die Nutzung der Parameter, sie fügt keine hinzu.
- Konsistenz bei sehr langen Kontexten
- Einem Gedankengang über Zehntausende von Tokens zu folgen, bleibt für ein kleines Modell schwieriger, ob es nun destilliert ist oder nicht.
Es gibt auch ein subtileres Risiko: Ein destilliertes Modell kann die Form des Denkprozesses des Lehrermodells nachahmen, ohne stets dessen Richtigkeit zu erreichen. Es „tut so, als würde es nachdenken“, und wirkt dabei überzeugend, kann sich aber bei einem Problem, das seine Fähigkeiten übersteigt, selbstsicher irren. Eine schön formulierte Gedankenkette garantiert keine korrekten Ergebnisse – das sollten Sie immer überprüfen, besonders bei wichtigen Entscheidungen.
#Eine gute Distillation erkennen
Nicht alle destillierten Modelle sind gleich gut. Bevor Sie eines herunterladen, können Sie anhand einiger Anhaltspunkte seine Qualität fundiert beurteilen, ohne Experte zu sein.
- Ein klar benanntes Lehrermodell
- Eine gute Modellbeschreibung nennt das Lehrermodell klar (z. B. „aus R1 destilliert“). Ein Lehrermodell mit gutem Ruf ist zunächst ein gutes Zeichen.
- Klare Basis
- Auf welcher Architektur basiert das Schülermodell (Qwen, Llama…)? Eine solide und gut unterstützte Basis erleichtert die lokale Nutzung.
- Gezielte Benchmarks
- Schauen Sie sich die Ergebnisse für die angestrebten Aufgaben (Mathematik, Programmieren, Schlussfolgern) an, statt auf einen vagen Gesamtwert zu achten. Vergleichen Sie außerdem mit dem nicht destillierten Modell gleicher Größe.
- Das Verhältnis zwischen Modellgröße und Leistungsversprechen
- Seien Sie skeptisch, wenn ein sehr kleines Modell als einem riesigen Modell in allen Bereichen ebenbürtig angepriesen wird. Destillation hilft, vollbringt aber keine Wunder.
- Reflexionsformat
- Prüfen Sie bei einem durch Destillation gewonnenen Reasoning-Modell, ob es seine Gedankenkette tatsächlich offenlegt und ob diese relevant und nicht nur dekorativ ist.
#Die wichtigsten destillierten Modelle zum lokalen Ausprobieren
Hier sind die destillierten Modelle, die 2026 einen Blick wert sind, vom kleinsten bis zum anspruchsvollsten, mit ihrem ungefähren Speicherbedarf in Q4_K_M.
- DeepSeek-R1-Distill-Qwen-1.5B
- ≈ 1,5 GB. Auf winzige Modelle setzen: läuft sogar auf einer CPU oder einem kleinen Laptop. Für seine Größe beeindruckend bei Mathematikaufgaben.
- DeepSeek-R1-Distill-Qwen-7B
- ≈ 5 GB, auf einer Grafikkarte mit 8 GB. Der ideale Einstieg, um im Alltag das Reasoning eines destillierten Modells kennenzulernen.
- DeepSeek-R1-Distill-Qwen-14B
- ≈ 9 GB, ausgelegt für eine RTX 3060 mit 12 GB oder eine RTX 4070. Das beste Verhältnis von Reasoning-Leistung zu erschwinglicher Hardware.
- DeepSeek-R1-Distill-Qwen-32B
- ≈ 19 GB, für eine RTX 4090 mit 24 GB. Dem Lehrermodell am nächsten, sofern Ihr VRAM ausreicht.
Wenn Sie gerade erst einsteigen, beginnen Sie mit der 7B- oder 14B-Version: Sie zeigen den Nutzen der Destillation auf einer einzigen Consumer-Grafikkarte, ohne den Aufwand großer Konfigurationen. Die 1.5B-Version ist eine ausgezeichnete Experimentierumgebung, um das Reasoning-Verhalten auch ohne GPU zu verstehen.
#Ein destilliertes Modell in 3 Minuten ausprobieren
Wenn Ollama bereits installiert ist und auf seinem Standardport lauscht (http://localhost:11434), reichen zwei Befehle aus, um einen Eindruck davon zu bekommen, was die Destillation gegenüber einem klassischen Modell gleicher Größe bringt.
- 01Ein destilliertes Modell herunterladen und startenHolen Sie sich ein R1-Distill-Modell und chatten Sie damit. Beim ersten Start wird das Modell heruntergeladen (einige GB je nach gewählter Größe).
- 02Eine Denkaufgabe stellenGeben Sie ihm eine Mathematik- oder Logikaufgabe, die mehrere Lösungsschritte erfordert. Beobachten Sie seine Gedankenkette: Es führt einen Gedankengang aus, bevor es zu einem Ergebnis kommt.
- 03Mit dem nicht destillierten Modell vergleichenStarten Sie das klassische Qwen-Modell derselben Größe und stellen Sie dieselbe Frage. Das destillierte Modell sollte bei gleichem VRAM-Bedarf und gleicher Geschwindigkeit strukturierter schlussfolgern.
#Weiterführende Informationen
Die Distillation lässt sich besser verstehen, wenn man sie mit anderen Grundbegriffen der lokalen KI verknüpft. Diese Leitfäden führen diesen Leitfaden direkt weiter:
- DeepSeek R1 mit Ollama installieren
- Die Schritt-für-Schritt-Anleitung, um die destillierten 7B-/14B-/32B-Versionen lokal auszuführen, mit den VRAM-Anforderungen für jede Größe.
- MoE erklärt: Warum ein 30B-A3B wie ein kleines Modell läuft
- Der andere große Architekturkniff, der große Modelle lokal nutzbar macht und die Wissensdestillation ergänzt.
- Quantisierung wählen (Q4, Q5, Q8, FP16)
- Sobald Sie Ihr destilliertes Modell ausgewählt haben, bestimmt die Quantisierung dessen endgültigen Speicherbedarf auf Ihrer Grafikkarte.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.