Fortgeschritten 14 Min.Fine-tuning

Unsloth: Ein LLM auf einer großen Grafikkarte zu finetunen public

Direkte Antwort

Unsloth ist eine freie Python-Bibliothek (Apache 2.0 für den Kern, über 76.000 Sterne auf GitHub), die die aufwendigen Schritte des Fine-Tunings mit LoRA und QLoRA neu implementiert: laut Anbieter bis zu doppelt so schnell mit 70 % weniger VRAM. Die Dokumentation nennt mindestens 6 GB für ein Modell mit 8 Milliarden Parametern bei QLoRA mit 4 Bit: Eine Karte mit 12 GB reicht aus; anschließend führt der GGUF-Export zu Ollama.

Unsloth macht das Fine-Tuning eines offenen Modells auf einer handelsüblichen Grafikkarte möglich: dieselben Methoden wie anderswo, aber neu geschriebene Rechenkerne, die den Zeit- und Speicherbedarf reduzieren. Ein Modell mit 7 oder 8 Milliarden Parametern lässt sich so auf einer Grafikkarte mit 12 GB feinabstimmen, und das Ergebnis lässt sich als GGUF exportieren, um in Ollama zu laufen. Es bleibt die Frage, die vor allem anderen kommt: Brauchen Sie wirklich Fine-Tuning?

Von Mohamed Meguedmi·Aktualisierung 2026-09-29·Unter Windows, macOS und Linux getestet

#Die Frage, die vor der Installation geklärt werden muss

Ja, ein Modell mit 7 oder 8 Milliarden Parametern lässt sich auf einer Consumer-Grafikkarte fine-tunen: Die Dokumentation von Unsloth nennt für QLoRA mit 4 Bit einen Mindestbedarf von 5 bis 6 GB VRAM. Eine Grafikkarte mit 12 GB ist daher geeignet und bietet Spielraum für Kontext und Batch. Unsloth implementiert die aufwendigen Schritte des LoRA- und QLoRA-Fine-Tunings neu, um laut Anbieter bis zu doppelt so schnell zu sein und dabei 70 % weniger VRAM zu benötigen. Diese Zahlen gelten allerdings nur für bestimmte Notebooks. Das Ergebnis lässt sich als GGUF exportieren, um es in Ollama auszuführen. Die eigentliche Frage stellt sich jedoch vor der Installation: Fine-Tuning verändert das Verhalten eines Modells (Ton, Format, Sprachregister), es aktualisiert aber nicht dessen Wissen. Wenn das Modell Ihre Dokumente kennen soll, bauen Sie zunächst eine Dokumentensuche auf. Rechnen Sie außerdem damit, dass die Vorbereitung des Datensatzes mehr Zeit benötigt als das Training.

Fine-Tuning verändert das Verhalten eines Modells. Die Dokumentensuche verändert, was es zum Zeitpunkt der Antwort weiß. Wer beides verwechselt, verliert Wochen.

Das, was Sie wollen, und das entsprechende Tool
Ihr BedarfDie richtige Antwort
Antworten basierend auf Ihren DokumentenEine RAG-Pipeline: Die Dokumente können sich täglich ändern
Ein einheitliches AusgabeformatFine-Tuning oder Generierung unter vorgegebenen Einschränkungen
Ein eigener Ton, eine branchenspezifische AusdrucksweiseFine-tuning
Das Vokabular eines spezialisierten FachbereichsFine-Tuning mit genügend Beispielen
Informationen, die sich häufig ändernImmer RAG: Für eine Preisangabe neu zu trainieren ergibt keinen Sinn
Kürzere oder längere AntwortenZuerst der Systemprompt; niemals dafür trainieren
i
Wenn die ehrliche Antwort lautet: „Ich möchte, dass er unsere Dokumentation kennt“
Halten Sie hier inne und bauen Sie zunächst eine Dokumentensuche auf. Sie lässt sich durch das Hinzufügen einer Datei aktualisieren und nennt ihre Quellen, was Fine-Tuning nicht tut. Der Unsloth-Leitfaden vertritt übrigens eine andere Sichtweise: Demnach kann Fine-Tuning Wissen vermitteln und alles nachbilden, was RAG leistet, während das umgekehrt nicht gilt. Das stimmt grundsätzlich; das praktische Argument für RAG liegt jedoch anderswo: in der Aktualisierung, der Nachvollziehbarkeit und den Kosten eines erneuten Trainings bei jeder Änderung.

#Was Unsloth konkret verändert

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Die Methode ist nicht neu: Die Modellgewichte werden eingefroren, und trainiert werden nur kleine Matrizen, die zu jedem Gewicht hinzugefügt werden – laut dem Unsloth-Leitfaden etwa 1 % der Parameter. LoRA behält das ursprüngliche Modell in 16 Bit bei, QLoRA quantisiert es auf 4 Bit, wodurch 75 % Speicher eingespart werden. Das ist das Standardverfahren und gehört nicht Unsloth.

Der Beitrag der Bibliothek liegt in der Implementierung: Für die rechenintensiven Schritte wurden die Rechenkerne neu geschrieben. Das Projekt gibt es in drei Formen: Unsloth Desktop, eine native Anwendung, Unsloth Studio, eine Weboberfläche, und Unsloth Core, die per Code gesteuerte Version, um die es in diesem Artikel geht. Es wird unter einer Doppellizenz veröffentlicht: Apache 2.0 für den Kern, AGPL-3.0 für bestimmte optionale Komponenten wie die Studio-Oberfläche. Das Projekt gibt an, Sprach-, Diffusions-, Sprachsynthese- und Embedding-Modelle doppelt so schnell mit 70 % weniger VRAM zu trainieren, ohne Genauigkeitsverlust. Bei Mixture-of-Experts-Architekturen (MoE) fällt der veröffentlichte Zugewinn noch größer aus: Bei bestimmten neueren Modellen ist das Training bis zu 12-mal so schnell und spart mehr als 35 % VRAM. Wie alle Leistungsangaben von Anbietern beschreiben diese Zahlen den besten Fall: Das README selbst zeigt, dass „doppelt so schnell, 70 % weniger VRAM“ nur für bestimmte Notebooks gilt.

Von Unsloth angegebene Verbesserungen je nach Notebook (Zahlen des Anbieters)
NotebookAngegebene GeschwindigkeitAngegebener VRAM
Llama 3.1 (8B) Alpaca2 mal mehr schnell70 % weniger
gpt-oss (20B)2 mal mehr schnell70 % weniger
Qwen3.5 (4B), Vision1,5-mal schneller60 % weniger
Gemma 4 (E2B), Vision1,5-mal schneller50 % weniger
Orpheus-TTS (3B)1,5-mal schneller50 % weniger
embeddinggemma (300M)2 mal mehr schnell20 % weniger

#Welche Karte für welches Modell

Von Unsloth veröffentlichter Mindestbedarf für das Fine-Tuning (GB VRAM)
ModellgrößeQLoRA (4 Bit)LoRA (16 Bit)Einordnung für eine Consumer-Grafikkarte
3 Milliarden3,58Mit QLoRA auf jeder aktuellen Grafikkarte komfortabel nutzbar
7 Milliarden519QLoRA mit 8 GB; LoRA mit 16 Bit erfordert eine Karte mit 24 GB
8 Milliarden622QLoRA mit 8 GB oder mehr; 12 GB lassen Spielraum
14 Milliarden8,533QLoRA mit 12 GB möglich; LoRA mit 16 Bit ist auf einer Karte mit 24 GB nicht möglich
27 Milliarden2264QLoRA auf 24 GB, ohne Reserven; LoRA mit 16 Bit ist auf einer einzigen Karte nicht möglich
32 Milliarden2676Über 24 GB, selbst bei QLoRA
70 Milliarden41164Mit einer Consumer-Grafikkarte nicht machbar

Die Dokumentation stellt klar, dass diese Werte absolute Mindestwerte sind: Je nach Modell kann mehr Speicher erforderlich sein. Sie nennt eine zu hohe Batchgröße als häufige Ursache für ausgeschöpften Speicher und empfiehlt, sie auf 1, 2 oder 3 zu reduzieren sowie für die ersten Tests eine Kontextlänge von 2048 zu verwenden.

Unterstütztes Hardware-Setup gemäß der Unsloth-Dokumentation
PlattformWas die Dokumentation sagt
NVIDIA, mit Unsloth CoreLinux und Windows; mindestens Compute Capability 7.0 (V100, T4, RTX 20 und neuere Serien, A100, H100), einschließlich Blackwell und DGX Spark. Die GTX 1070 und 1080 funktionieren, allerdings langsam.
AMD und IntelEigene Anleitungen; das Training funktioniert auf diesen GPUs sowohl mit Core als auch mit Studio.
MacUnsloth Studio unterstützt Training, MLX und GGUF-Inferenz (macOS 12 oder neuer). Für Core ist die Unterstützung von Apple Silicon (MLX) als „in Vorbereitung“ angegeben.
Ohne GPUStudio lässt sich für Chats mit GGUF-Modellen und zur Datenvorbereitung nutzen, nicht zum Training.
Mehrere GPUsUnterstützt durch Accelerate und DeepSpeed (FSDP, DDP) mit manueller Einrichtung; die Option device_map="balanced" verteilt ein zu großes Modell auf mehrere Karten.
i
Prüfen Sie die aktuelle Seite
In diesem Bereich ändert sich vieles schnell: Die README-Datei kündigt inzwischen Training auf AMD-GPUs unter Windows, WSL und Linux sowie eine Desktop-Anwendung an. Prüfen Sie die aktuelle Dokumentation, bevor Sie Hardware kaufen.
!
Studio über das Netzwerk zugänglich: Server-Tools aktiviert
Die README von Unsloth warnt davor, dass die serverseitigen Tools von Studio standardmäßig aktiviert sind. Wenn Sie die Oberfläche zugänglich machen (--secure, nicht lokaler Host, LAN-Zugriff), ist ein Administratorpasswort erforderlich; --disable-tools deaktiviert diese Tools. Belassen Sie die Oberfläche auf 127.0.0.1, solange Sie sie nicht für den Zugriff von außen öffnen müssen.

#Die eigentliche Arbeit steckt im Datensatz

Ein Fine-Tuning scheitert nie wegen der Bibliothek. Es scheitert wegen der Daten.

Format
Meist ein Datensatz mit zwei Spalten, Frage und Antwort, in der vom Modell erwarteten Gesprächsstruktur. Der Leitfaden empfiehlt, von einem Instruct-Modell auszugehen: Es akzeptiert Gesprächsvorlagen (ChatML, ShareGPT) direkt und benötigt weniger Daten als ein Basismodell. Einheitlichkeit zählt mehr als Umfang.
Umfang
Der Unsloth-Leitfaden empfiehlt als absolutes Minimum 100 Zeilen und für bessere Ergebnisse mehr als 1.000 Zeilen. Ton und Format lassen sich mit wenigen Beispielen verändern; ein wirklich auf fachliche Aufgaben zugeschnittenes Verhalten erfordert mehr Beispiele, die untereinander konsistent sind.
Qualität
Das Modell ahmt nach, was man ihm zeigt, einschließlich der Fehler. Ein systematischer Fehler in den Daten wird zu einem systematischen Fehler des Modells.
Kontrolldatensatz
Beispiele, die das Modell während des Trainings nie gesehen hat. Ohne sie ist es unmöglich, das Lernen vom einfachen Auswendiglernen zu unterscheiden.
Ohne Code
Unsloth Studio bietet Data Recipes, die PDF-, CSV- oder DOCX-Dateien über einen visuellen Workflow in Datensätze umwandeln und eine Vorschau anzeigen, bevor die vollständige Erstellung gestartet wird.
!
Überanpassung sieht wie ein Erfolg aus
Der Unsloth-Leitfaden bringt es in einem Satz auf den Punkt: Wenn der Verlust auf 0 fällt, kann das auf Überanpassung hindeuten, und die Validierung muss geprüft werden. Ein Verlust zwischen 0,5 und 1,0 ist laut dem Leitfaden in vielen Fällen ein gutes Zeichen, hängt aber vom Datensatz und der Aufgabe ab. Ein Modell, das die Trainingsdaten auswendig gelernt hat, beantwortet Ihre Testfragen perfekt und alles andere schlechter als zuvor. Halten Sie 20 % der Daten für den Test zurück, streben Sie 1 bis 3 Epochen an, um Überanpassung zu begrenzen, und beobachten Sie den Kontrolldatensatz statt der Trainingskurve.

#Vom Adapter zum nutzbaren Modell

Der Ablauf besteht aus drei Schritten: ein Modell in 4 Bit laden, es mit einem der offiziellen Notebooks trainieren und anschließend exportieren. Der erste Codeblock lädt das Modell und fügt die LoRA-Adapter hinzu; das eigentliche Training übernimmt eines der Unsloth-Notebooks, das Sie laut diesem Leitfaden in Ihre lokale Umgebung kopieren sollten.

Ein Modell im 4-Bit-Format mit Unsloth Core laden
from unsloth import FastLanguageModel

model, tokenizer = FastLanguageModel.from_pretrained(
    model_name="unsloth/Qwen3-8B-unsloth-bnb-4bit",  # quantification dynamique 4 bits d'Unsloth
    max_seq_length=2048,
    load_in_4bit=True,
)
model = FastLanguageModel.get_peft_model(model, r=16, lora_alpha=16)

Die Endung des Namens ist entscheidend. Laut dem Leitfaden handelt es sich bei einem Modell, dessen Name auf unsloth-bnb-4bit endet, um eine dynamische 4-Bit-Quantisierung von Unsloth: Diese benötigt etwas mehr VRAM als eine standardmäßige BitsAndBytes-Quantisierung, bietet aber eine deutlich höhere Genauigkeit. Ein Name, der nur auf bnb-4bit endet, bezeichnet die Standardversion. Der Leitfaden ergänzt, dass es für Training und Bereitstellung vorteilhaft ist, dieselbe numerische Präzision zu verwenden: Wer das Modell in 4 Bit bereitstellt, trainiert es auch in 4 Bit.

Standard-Einstellungen des offiziellen Leitfadens
ParameterWert laut LeitfadenGut zu wissen
per_device_train_batch_size2Größer: bessere Nutzung des GPUs, aber langsamerer Trainingsprozess durch die Auslastung; bevorzugen Sie gradient_accumulation_steps
gradient_accumulation_steps4Simuliert einen größeren Batch ohne zusätzlichen Speicherbedarf
max_steps60Wert für einen schnellen Test; für ein echtes Training durch num_train_epochs mit einem Wert zwischen 1 und 3 ersetzen
learning_rate2e-4Niedriger für ein langsameres und präziseres Fine-Tuning: 1e-4, 5e-5 oder 2e-5 ausprobieren
max_seq_length2048Empfohlene Länge für Tests. Sie höher anzusetzen, „um auf Nummer sicher zu gehen“, reserviert Speicher für Sequenzen, die in Ihren Daten gar nicht vorkommen: Messen Sie zuerst die tatsächliche Länge Ihrer Beispiele
  1. 01
    Trainieren
    Das Ergebnis ist ein LoRA-Adapter, etwa 100 MB groß im Beispiel von Unsloth, kein vollständiges Modell.
  2. 02
    Beurteilen
    Anhand des Kontrolldatensatzes und im Vergleich zum ursprünglichen Modell. „Besser“ muss nachgewiesen werden und darf nicht einfach angenommen werden. Der Leitfaden weist darauf hin, dass automatische Evaluationswerkzeuge Ihre Kriterien möglicherweise nur unzureichend widerspiegeln.
  3. 03
    Zusammenführen oder getrennt halten
    Der Adapter kann getrennt bleiben und austauschbar sein oder in die Gewichte integriert werden: model.save_pretrained_merged mit save_method="merged_16bit".
  4. 04
    In GGUF exportieren und quantisieren
    model.save_pretrained_gguf erzeugt die Datei mit q4_k_m, q8_0 oder f16 je nach Wahl. Damit ist das Ergebnis für Ollama oder llama.cpp auf normalen Geräten ausführbar.
Ein trainiertes Modell im GGUF-Format exportieren (in derselben Sitzung)
model.save_pretrained_gguf(
    "mon-modele-q4", tokenizer, quantization_method="q4_k_m"
)
# puis, avec le Modelfile fourni : ollama create mon-modele -f Modelfile
!
Das exportierte Modell gibt in Ollama unsinnige Antworten
Ein häufiger Fall, den die Unsloth-Dokumentation beschreibt: Das Modell funktioniert in Unsloth gut, liefert nach dem Export aber Kauderwelsch, endlose Ausgaben oder Wiederholungen. Die häufigste Ursache ist ein Chat-Template, das von dem beim Training verwendeten abweicht. Beim Training und bei der Inferenz muss dasselbe Chat-Template verwendet werden, ebenso das richtige Token für das Sequenzende. Außerdem muss geprüft werden, dass die Engine kein zusätzliches Start-Token einfügt. Die Dokumentation erläutert, dass Unsloth das Ollama-Modelfile automatisch mit dem beim Fine-Tuning verwendeten Template erstellt.

#Klassische Fallen

Unwissentlich von einem Basismodell ausgehen
Der Leitfaden empfiehlt Instruct-Modelle: Sie unterstützen Gesprächsvorlagen und benötigen weniger Daten. Ein Basismodell erfordert ein anderes Format (Alpaca, Vicuna) und mehr Beispiele.
Die Chatvorlage vergessen
Formatierte Beispiele, die nicht dem erwarteten Modellformat entsprechen, führen zu einem technisch erfolgreichen, aber praktisch nutzlosen Training.
Anhand der Trainingsbeispiele messen
Dieser Fehler führt dazu, dass spektakuläre Ergebnisse angekündigt, aber enttäuschende Modelle geliefert werden.
Glauben, dass dies die Recherche in Dokumenten ersetzen wird
Was Sie dem Modell beibringen, veraltet, sobald sich Ihre Informationen ändern, und das Modell nennt seine Quellen nicht. Bei Fakten, die sich ändern, bleibt die Recherche in Dokumenten zuverlässiger.
Die Bereinigung der Beispiele unterschätzen
Fast identische Doppelungen in der Datensammlung lenken das Training in Richtung dieser spezifischen Fälle, ohne dass dies in den beobachteten Metriken sichtbar wird.
Mehrere Einstellungen gleichzeitig ändern
Die Lernrate, den Adapterrang und die Sequenzlänge im selben Versuch zu ändern, verhindert, dass sich feststellen lässt, welche Einstellung die beobachtete Änderung bewirkt hat.

#Konkrete Anwendungsfälle

Kundensupport mit einheitlichem Ton
Ein auf echten Dialogen feinabgestimmtes Modell antwortet in der Stimme der Marke, ohne dass Stilvorgaben in jedem Prompt wiederholt werden müssen.
Extraktion in einem strikten Format
Fine-Tuning anhand von Eingabe-Ausgabe-Beispielen legt das Ausgabeformat zuverlässiger fest als ein Prompt allein, was vor der Weitergabe des Ergebnisses an ein nachgelagertes System hilfreich ist.

Diese Fälle haben eines gemeinsam: Jeder lässt sich messen. Bevor Sie ein Training starten, formulieren Sie das Erfolgskriterium in einem überprüfbaren Satz – beispielsweise „Das JSON-Format wird bei mindestens 95 % der Ausgaben für den Kontrolldatensatz eingehalten“ – statt sich auf den allgemeinen Eindruck einer Verbesserung zu verlassen. Dieses Kriterium, nicht die Intuition, zeigt, ob das Ergebnis die investierte Zeit rechtfertigt.

#Die tatsächlichen Kosten über den Preis der Grafikkarte hinaus

Die Grafikkarte ist nur ein Aufwandsposten unter vielen. Konsistente Beispiele zu sammeln und zu bereinigen, einen Kontrolldatensatz zu erstellen, den das Modell niemals zu sehen bekommt, und anschließend jede Version mit dem ursprünglichen Modell zu vergleichen, fällt oft stärker ins Gewicht als das Training selbst, das der Unsloth-Leitfaden anhand eines Versuchs mit 60 Schritten veranschaulicht.

Deshalb verkürzt Unsloth die Dauer eines Projekts nicht so stark, wie man es sich erhofft, so schnell es beim Training auch sein mag: Es beseitigt den technischen Engpass, nicht die Arbeit an den Daten.

→
Die Dauer des ersten Versuchs messen
Der Leitfaden von Unsloth schlägt max_steps = 60 vor, um schnell voranzukommen. Ein erster vollständiger Probelauf mit einem verkleinerten Datensatz von einigen Hundert Beispielen, einschließlich Training und Evaluation, liefert eine Schätzung der Gesamtzeit, bevor Sie den vollständigen Datensatz in Angriff nehmen.

#FAQ

Ist Unsloth kostenlos?+
Die Kernbibliothek steht unter der Lizenz Apache 2.0 und ermöglicht kostenloses LoRA- und QLoRA-Fine-Tuning; das Repository hat mehr als 76.000 Sterne auf GitHub. Einige optionale Komponenten, etwa die Studio-Oberfläche, stehen unter der Lizenz AGPL-3.0: Die Dokumentation beschreibt diese Doppellizenz als Möglichkeit, das Projekt zu finanzieren und dabei offen zu halten. Die Notebooks laufen kostenlos in Colab und Kaggle.
Welche Karte benötigt man, um ein 7-Milliarden-Parameter-Modell anzupassen?+
Die Unsloth-Tabelle nennt mindestens 5 GB für ein Modell mit 7 Milliarden Parametern bei QLoRA mit 4 Bit und 19 GB bei LoRA mit 16 Bit. Eine Grafikkarte mit 12 GB eignet sich daher für QLoRA. Die Dokumentation stellt klar, dass dies absolute Mindestwerte sind und dass die Batchgröße oder lange Beispiele mehr Speicher erfordern können.
Wie viele Beispiele sind erforderlich?+
Der Unsloth-Leitfaden empfiehlt als absolutes Minimum 100 Zeilen und für bessere Ergebnisse mehr als 1.000 Zeilen; wenn der Datensatz zu klein ist, können synthetische Daten oder ein Datensatz von Hugging Face hinzugefügt werden. Konsistenz ist wichtiger als die Anzahl: Schlechte Beispiele vermitteln schlechte Gewohnheiten genauso sicher, wie gute Beispiele gute Gewohnheiten vermitteln.
Läuft das entstandene Modell in Ollama?+
Ja: Man exportiert mit model.save_pretrained_gguf ins GGUF-Format, wählt die Quantisierung (q4_k_m wird in der Dokumentation empfohlen) und erstellt anschließend das Modell in Ollama mit einem Modelfile. Unsloth erzeugt dieses Modelfile mit dem beim Training verwendeten Konversationstemplate. Falls die Antworten inkohärent werden, prüfen Sie zunächst, ob das Template und das End-of-Sequence-Token dieselben wie beim Training sind.
Funktioniert das mit AMD, auf dem Mac oder ohne GPU?+
Ja, für AMD und Intel gibt es eigene Anleitungen. Auf dem Mac unterstützt Unsloth Studio Training und Inferenz mit GGUF; Core ist dort für Apple Silicon noch nicht verfügbar. Ohne GPU dient Studio dem Chat und der Datenvorbereitung, nicht dem Training. Core benötigt eine NVIDIA-Karte mit Compute Capability 7.0 oder höher.
Macht Fine-Tuning das Modell zum Experten für meine Daten?+
Nicht dauerhaft. Der Leitfaden von Unsloth besagt, dass Fine-Tuning Wissen vermitteln kann, doch dieses veraltet, sobald sich Ihre Daten ändern, während sich ein Dokument in einer Minute ersetzen und als Quelle zitieren lässt. Fakten und Dokumente gehören zur Dokumentenrecherche; Ton, Format und Sprachregister zum Fine-Tuning. Beides zu kombinieren ist üblich.

Empfohlene Hardware: RTX 5070 Ti 16 GB — NVIDIA-Grafikkarte mit 16 GB, ausreichend, um ein 7–8B-Modell mit QLoRA feinzujustieren. Alle KI-Hardware →

Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.