Einsteiger 8 minKonzepte

Destillation: Wie kleine Modelle von den gros

Sie sind wahrscheinlich schon auf Namen wie DeepSeek-R1-Distill-Qwen-14B gestoßen und haben sich gefragt, warum ein „kleines“ Modell plötzlich fast so gut schlussfolgern kann wie ein riesiges. Die Antwort lässt sich in einem Wort zusammenfassen: Destillation. Diese Technik ermöglicht es einem kompakten Modell, das Verhalten eines viel größeren Modells zu übernehmen, ohne dessen Größe oder Langsamkeit zu haben. Dieser Leitfaden erklärt die LLM-Destillation anhand des Bildes von Lehrer und Schüler, erläutert, was tatsächlich übertragen wird und was dabei auf der Strecke bleibt, und zeigt, wie Sie eine gelungene Destillation erkennen, bevor Sie das destillierte Modell bei sich zu Hause ausführen.

Von Clara M.·Aktualisierung 2026-08-07·Unter Windows, macOS und Linux getestet

#Das Problem, das die Destillation löst

Die besten offenen Modelle sind riesig: mehrere hundert Milliarden Parameter. Sie sind brillant, aber auf einem handelsüblichen Rechner nicht nutzbar: Sie benötigen mehrere zehn Gigabyte VRAM und erzeugen Text nur langsam. Umgekehrt passt ein 7B- oder 14B-Modell auf eine Gaming-Grafikkarte und antwortet schnell, doch ihm fehlt oft die Fähigkeit seines großen Bruders, differenziert zu schlussfolgern.

Man möchte also einen Teil der Fähigkeiten eines großen Modells in ein Format übertragen, das lokal läuft. Der naive Ansatz wäre, ein kleines Modell einfach erneut mit denselben Rohdaten wie das große zu trainieren. Das reicht nicht: Wenn ein kleineres Modell allein aus einem Meer von Text lernt, wird es zwar brauchbar, aber nicht außergewöhnlich. Die Destillation bietet eine Abkürzung: Statt die Welt von Grund auf neu kennenzulernen, lernt das kleine Modell direkt vom großen.

i
Die Grundidee in einem Satz
Die Distillation ist nicht das Komprimieren eines großen Modells. Es handelt sich um das Trainieren eines kleinen Modells, das die Antworten und den Denkstil eines Großmodells nachahmt – wie ein Schüler, der dem Meister beim Arbeiten zuschaut.

#Das Lehrer-Schüler-Prinzip

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Bei der Distillation kommen zwei Modelle zum Einsatz. Der „Lehrer“ ist das große, sehr leistungsfähige Modell, das man nachahmen möchte. Der „Schüler“ ist das kleine Modell, das trainiert wird. Das Prinzip: Man stellt dem Lehrer Tausende von Fragen, sammelt seine Antworten und trainiert den Schüler darauf, dieselben Antworten zu erzeugen. Der Schüler lernt nicht mehr anhand von unbearbeiteten Texten aus dem Web, sondern anhand von Beispielen, die ein Expertenmodell bereits „vorgekaut“ hat.

Der entscheidende Unterschied liegt darin, was der Schüler genau kopiert. In der umfassendsten Variante ahmt er nicht nur das vom Lehrer gewählte endgültige Wort nach, sondern die gesamte Wahrscheinlichkeitsverteilung für das nächste Wort: Der Lehrer sagt nicht einfach „Die Antwort ist Katze“, sondern gibt an: „Katze sehr wahrscheinlich, Hund etwas wahrscheinlich, Toaster nahezu unmöglich“. Diese Nuancen – manchmal als Soft Labels bezeichnet – enthalten Informationen, die die richtige Antwort allein nicht liefert.

Lehrer (teacher)
Das große Referenzmodell, teuer, aber hervorragend. Es dient als Quelle und wird nicht bei Ihnen bereitgestellt.
Schüler (student)
Das kleine Modell, das darauf trainiert wird, das Verhalten des Lehrers nachzubilden. Dieses Modell werden Sie lokal ausführen.
Soft labels
Die differenzierten Wahrscheinlichkeiten des Lehrermodells für jedes mögliche Wort, nicht nur für das Wort mit der höchsten Wahrscheinlichkeit. Das reichhaltigste Ausgangsmaterial für die Destillation.
Distillationsdatensatz
Die Gesamtheit der gestellten Fragen und der Antworten des Lehrers, mit der der Schüler trainiert.
→
Ein mentales Bild
Ein Student kann allein aus Büchern lernen oder vom besten Lehrer des Landes, der ihm nicht nur die richtige Antwort zeigt, sondern auch seinen Gedankengang, seine Zweifel und das, was er verwirft. Im zweiten Fall macht der Student bei gleichem Aufwand viel schneller Fortschritte. Bei der Distillation stellt man dem kleinen Modell diesen Lehrer zur Seite.

#Was tatsächlich übertragen wird

Oft wird angenommen, dass die Destillation „das Wissen“ des großen Modells überträgt. Das stimmt teilweise, ist aber ungenau. Am besten lassen sich vor allem Verhaltensweisen und Vorgehensweisen übertragen, eher als reine Fakten. Ein kleines Modell hat eine begrenzte Speicherkapazität: Es kann sich nicht alles aus der internen Enzyklopädie eines riesigen Modells merken. Methoden hingegen kann es sehr gut übernehmen.

Der Denkstil
Die Art und Weise, ein Problem in Schritte zu zerlegen und eine Gedankenkette vor der Schlussfolgerung aufzubauen. Das wird am besten übertragen und ist das Herzstück von R1-Distill.
Format der Antworten
Die Struktur, der Ton, die Art und Weise, eine Erklärung oder Code zu organisieren. Der Schüler übernimmt die Schreibgewohnheiten des Lehrers.
Die Lösungsansätze
Bei Mathematik, Programmierung oder Logik übernimmt der Schüler bewährte Lösungswege: wie man an einen bestimmten Problemtyp herangeht und welche Prüfungen man durchführt.
Ein Teil der Kenntnisse
Fakten und Zusammenhänge, ja, aber nur im Rahmen der Kapazität des kleinen Modells. Dieser Bereich lässt sich am schlechtesten übertragen.

Diese Unterscheidung ist entscheidend, um neuere destillierte Modelle zu verstehen. Wenn DeepSeek R1 in ein Qwen-14B-Modell destilliert, geht es nicht darum, das gesamte Allgemeinwissen von R1 in 14 Milliarden Parametern unterzubringen – das ist unmöglich. Ziel ist es, dessen Art zu schlussfolgern zu übertragen: Schritt für Schritt nachzudenken, sich zu korrigieren und einen Beweis auszuführen. Und das kann ein kleines Modell bemerkenswert gut lernen.

i
Verhalten im Vergleich zu Kenntnissen
Merken Sie sich diese Regel: Die Destillation überträgt vor allem Fähigkeiten und Gewohnheiten (wie man denkt), weniger reine Fakten (was man wissen sollte). Ein destilliertes Modell kann wie ein Riese schlussfolgern und dabei weniger wissen als dieser.

#Warum ein destilliertes 14B-Modell ein klassisches 14B-Modell schlägt

Hier kommt der Punkt, der der Intuition widerspricht. Zwei Modelle sind genau gleich groß – 14 Milliarden Parameter – und haben daher denselben VRAM-Bedarf und dieselbe Geschwindigkeit. Trotzdem ist das destillierte Modell dem klassischen beim logischen Schlussfolgern oft deutlich überlegen. Die Größe hat sich nicht verändert; nur die Trainingsmethode hat sich geändert. Wie kann dieselbe Anzahl an Parametern ein viel besseres Modell ergeben?

Weil das Training die Parameter nicht zufällig befüllt, sondern organisiert. Ein klassisches 14B-Modell lernt allein aus Rohtext; es entwickelt brauchbare, aber generalistische Fähigkeiten. Ein destilliertes 14B-Modell lernt anhand von Beispielen, die von einem erstklassigen Lehrermodell erzeugt wurden, oft mit vollständig ausgeführten Gedankengängen. Seine 14 Milliarden Parameter vernetzen sich rund um gute Methoden, statt von allem ein bisschen abzubilden. Bei gleicher Kapazität macht die Qualität des Trainingssignals den Unterschied.

Gleiche Kosten, besseres Signal
Das destillierte Modell ist weder größer noch langsamer, hat aber anhand von Material deutlich höherer Qualität gelernt: den Ausgaben eines Experten.
Informationsreiche Beispiele
Die Antworten des Lehrermodells enthalten zahlreiche korrekte und vollständige Gedankengänge, die im Rohtext des Webs selten vorkommen.
Weniger Rauschen
Das Web enthält viele Fehler und viel Durcheinander. Ein Lehrer filtert die Inhalte: Der Schüler lernt anhand bereinigter Inhalte.

Achten Sie darauf, nicht zu viel hineinzuinterpretieren: „Schlagen“ gilt vor allem für die Aufgaben, auf die die Destillation abzielt, typischerweise logisches Denken, Mathematik und Code. Bei reinem Allgemeinwissen oder detailliertem Faktenwissen wird der Abstand kleiner oder kehrt sich sogar um. Ein destilliertes Modell ist nicht auf magische Weise in allem überlegen – es ist dort überlegen, wo es darauf trainiert wurde.

#Der Fall der R1-Distill-Modelle

Das Beispiel, das die Distillation für den lokalen Einsatz populär gemacht hat, ist die Anfang 2025 veröffentlichte DeepSeek-R1-Distill-Familie. DeepSeek nahm sein großes Reasoning-Modell R1 als Lehrer und destillierte dessen Verhalten in mehrere Schülermodelle unterschiedlicher Größe, die auf bestehenden Architekturen wie Qwen und Llama basieren. Das Ergebnis: Modelle mit 1,5B, 7B, 8B, 14B und 32B, die mit einer sichtbaren Gedankenkette schlussfolgern – etwas, das zuvor den größten Modellen vorbehalten war.

R1-Distill-Qwen-1.5B
Winzig, läuft praktisch überall, auch ohne GPU. Für seine Größe erstaunlich gut bei einfachen mathematischen Aufgaben.
R1-Distill-Qwen-7B / Llama-8B
Der Kompromiss für den breiten Einsatz: ~5 GB in Q4 auf einer Grafikkarte mit 8 GB. Gute Reasoning-Fähigkeiten für den täglichen Gebrauch.
R1-Distill-Qwen-14B
≈ 9 GB in Q4, passend für eine RTX 3060 mit 12 GB oder eine RTX 4070 mit 12 GB. Der ideale Kompromiss zwischen Reasoning-Leistung und erschwinglicher Hardware.
R1-Distill-Qwen-32B
≈ 19 GB in Q4, für eine RTX 4090 mit 24 GB. Dem Lehrermodell am nächsten, sofern Ihr VRAM ausreicht.

Diese Modelle zeigen ihre Gedankenkette zwischen Denk-Tags, bevor sie die endgültige Antwort geben. Genau dieses Verhalten wurde vom Lehrermodell R1 übernommen. In der Praxis entwickelt ein R1-Distill-Qwen-14B bei einer Mathematikaufgabe einen strukturierten Gedankengang, während ein klassisches Qwen 14B eher schlicht antworten würde — bei gleichem Speicherbedarf.

!
Ein destilliertes Modell ist nicht „das echte R1“
DeepSeek-R1-Distill-Qwen-14B ist keine verkleinerte Version von R1: Es ist ein Qwen-14B-Modell, das gelernt hat, wie R1 zu schlussfolgern. Es übernimmt dessen Methode, aber nicht dessen gesamte Leistungsfähigkeit oder dessen gesamtes Wissen. Erwarten Sie nicht die Leistung des vollständigen 671B-Modells.

#Grenzen: Das, was nicht übertragen wird

Die Größe des Schülermodells setzt der Destillation eine Obergrenze. Den Ozean eines Riesen kann man nicht in einen Fingerhut gießen. Wer versteht, was dabei auf der Strecke bleibt, vermeidet Enttäuschungen und eine falsche Modellwahl.

Detailliertes Faktenwissen
Das kleine Modell kann sich nicht alles merken, was das Lehrermodell weiß. Bei sehr speziellen Fakten oder Nischenwissen halluziniert es leichter.
Robustheit bei Aufgaben außerhalb des destillierten Themenbereichs
Bei Aufgaben, die deutlich von dem abweichen, was durch Destillation vermittelt wurde, fällt das Schülermodell ungefähr auf das Niveau eines herkömmlichen Modells gleicher Größe zurück.
Die Kapazitätsbegrenzung
Ein destilliertes 7B-Modell bleibt ein 7B-Modell. Die Destillation optimiert die Nutzung der Parameter, sie fügt keine hinzu.
Konsistenz bei sehr langen Kontexten
Einem Gedankengang über Zehntausende von Tokens zu folgen, bleibt für ein kleines Modell schwieriger, ob es nun destilliert ist oder nicht.

Es gibt auch ein subtileres Risiko: Ein destilliertes Modell kann die Form des Denkprozesses des Lehrermodells nachahmen, ohne stets dessen Richtigkeit zu erreichen. Es „tut so, als würde es nachdenken“, und wirkt dabei überzeugend, kann sich aber bei einem Problem, das seine Fähigkeiten übersteigt, selbstsicher irren. Eine schön formulierte Gedankenkette garantiert keine korrekten Ergebnisse – das sollten Sie immer überprüfen, besonders bei wichtigen Entscheidungen.

i
Der richtige Ansatz
Nutzen Sie ein destilliertes Modell für das, was es gut kann — schlussfolgern, strukturieren, programmieren — und betrachten Sie seine Tatsachenbehauptungen kritisch. Für faktische Zuverlässigkeit ist ein RAG-System, das die Antworten des Modells auf Ihre Dokumente stützt, besser als das Modellgedächtnis allein.

#Eine gute Distillation erkennen

Nicht alle destillierten Modelle sind gleich gut. Bevor Sie eines herunterladen, können Sie anhand einiger Anhaltspunkte seine Qualität fundiert beurteilen, ohne Experte zu sein.

Ein klar benanntes Lehrermodell
Eine gute Modellbeschreibung nennt das Lehrermodell klar (z. B. „aus R1 destilliert“). Ein Lehrermodell mit gutem Ruf ist zunächst ein gutes Zeichen.
Klare Basis
Auf welcher Architektur basiert das Schülermodell (Qwen, Llama…)? Eine solide und gut unterstützte Basis erleichtert die lokale Nutzung.
Gezielte Benchmarks
Schauen Sie sich die Ergebnisse für die angestrebten Aufgaben (Mathematik, Programmieren, Schlussfolgern) an, statt auf einen vagen Gesamtwert zu achten. Vergleichen Sie außerdem mit dem nicht destillierten Modell gleicher Größe.
Das Verhältnis zwischen Modellgröße und Leistungsversprechen
Seien Sie skeptisch, wenn ein sehr kleines Modell als einem riesigen Modell in allen Bereichen ebenbürtig angepriesen wird. Destillation hilft, vollbringt aber keine Wunder.
Reflexionsformat
Prüfen Sie bei einem durch Destillation gewonnenen Reasoning-Modell, ob es seine Gedankenkette tatsächlich offenlegt und ob diese relevant und nicht nur dekorativ ist.
→
Der Test, der Klarheit schafft
Laden Sie sowohl das destillierte ALS AUCH das klassische Modell gleicher Größe herunter und stellen Sie beiden Ihre eigenen schwierigen Fragen im direkten Vergleich. Wenn das destillierte Modell bei Ihren tatsächlichen Anwendungsfällen besser schlussfolgert, ist es für Sie geeignet – das ist viel aussagekräftiger als ein öffentlicher Benchmark.

#Die wichtigsten destillierten Modelle zum lokalen Ausprobieren

Hier sind die destillierten Modelle, die 2026 einen Blick wert sind, vom kleinsten bis zum anspruchsvollsten, mit ihrem ungefähren Speicherbedarf in Q4_K_M.

DeepSeek-R1-Distill-Qwen-1.5B
≈ 1,5 GB. Auf winzige Modelle setzen: läuft sogar auf einer CPU oder einem kleinen Laptop. Für seine Größe beeindruckend bei Mathematikaufgaben.
DeepSeek-R1-Distill-Qwen-7B
≈ 5 GB, auf einer Grafikkarte mit 8 GB. Der ideale Einstieg, um im Alltag das Reasoning eines destillierten Modells kennenzulernen.
DeepSeek-R1-Distill-Qwen-14B
≈ 9 GB, ausgelegt für eine RTX 3060 mit 12 GB oder eine RTX 4070. Das beste Verhältnis von Reasoning-Leistung zu erschwinglicher Hardware.
DeepSeek-R1-Distill-Qwen-32B
≈ 19 GB, für eine RTX 4090 mit 24 GB. Dem Lehrermodell am nächsten, sofern Ihr VRAM ausreicht.

Wenn Sie gerade erst einsteigen, beginnen Sie mit der 7B- oder 14B-Version: Sie zeigen den Nutzen der Destillation auf einer einzigen Consumer-Grafikkarte, ohne den Aufwand großer Konfigurationen. Die 1.5B-Version ist eine ausgezeichnete Experimentierumgebung, um das Reasoning-Verhalten auch ohne GPU zu verstehen.

#Ein destilliertes Modell in 3 Minuten ausprobieren

Wenn Ollama bereits installiert ist und auf seinem Standardport lauscht (http://localhost:11434), reichen zwei Befehle aus, um einen Eindruck davon zu bekommen, was die Destillation gegenüber einem klassischen Modell gleicher Größe bringt.

  1. 01
    Ein destilliertes Modell herunterladen und starten
    Holen Sie sich ein R1-Distill-Modell und chatten Sie damit. Beim ersten Start wird das Modell heruntergeladen (einige GB je nach gewählter Größe).
  2. 02
    Eine Denkaufgabe stellen
    Geben Sie ihm eine Mathematik- oder Logikaufgabe, die mehrere Lösungsschritte erfordert. Beobachten Sie seine Gedankenkette: Es führt einen Gedankengang aus, bevor es zu einem Ergebnis kommt.
  3. 03
    Mit dem nicht destillierten Modell vergleichen
    Starten Sie das klassische Qwen-Modell derselben Größe und stellen Sie dieselbe Frage. Das destillierte Modell sollte bei gleichem VRAM-Bedarf und gleicher Geschwindigkeit strukturierter schlussfolgern.
Terminal
# Lancer un modèle distillé de raisonnement
ollama run deepseek-r1:14b

# Comparer avec le modèle classique de même taille
ollama run qwen3:14b
i
Den Gedankengang sehen
Bei einem R1-Distill beginnt die Antwort mit einer Denkphase (Gedankenkette), bevor die Schlussfolgerung folgt. Genau dieses Verhalten wurde vom Lehrermodell R1 übernommen – das sichtbare Zeichen dafür, dass die Destillation funktioniert hat.

#Weiterführende Informationen

Die Distillation lässt sich besser verstehen, wenn man sie mit anderen Grundbegriffen der lokalen KI verknüpft. Diese Leitfäden führen diesen Leitfaden direkt weiter:

DeepSeek R1 mit Ollama installieren
Die Schritt-für-Schritt-Anleitung, um die destillierten 7B-/14B-/32B-Versionen lokal auszuführen, mit den VRAM-Anforderungen für jede Größe.
MoE erklärt: Warum ein 30B-A3B wie ein kleines Modell läuft
Der andere große Architekturkniff, der große Modelle lokal nutzbar macht und die Wissensdestillation ergänzt.
Quantisierung wählen (Q4, Q5, Q8, FP16)
Sobald Sie Ihr destilliertes Modell ausgewählt haben, bestimmt die Quantisierung dessen endgültigen Speicherbedarf auf Ihrer Grafikkarte.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.