Unsloth: Ein LLM auf einer großen Grafikkarte zu finetunen public
Unsloth ist eine freie Python-Bibliothek (Apache 2.0 für den Kern, über 76.000 Sterne auf GitHub), die die aufwendigen Schritte des Fine-Tunings mit LoRA und QLoRA neu implementiert: laut Anbieter bis zu doppelt so schnell mit 70 % weniger VRAM. Die Dokumentation nennt mindestens 6 GB für ein Modell mit 8 Milliarden Parametern bei QLoRA mit 4 Bit: Eine Karte mit 12 GB reicht aus; anschließend führt der GGUF-Export zu Ollama.
Unsloth macht das Fine-Tuning eines offenen Modells auf einer handelsüblichen Grafikkarte möglich: dieselben Methoden wie anderswo, aber neu geschriebene Rechenkerne, die den Zeit- und Speicherbedarf reduzieren. Ein Modell mit 7 oder 8 Milliarden Parametern lässt sich so auf einer Grafikkarte mit 12 GB feinabstimmen, und das Ergebnis lässt sich als GGUF exportieren, um in Ollama zu laufen. Es bleibt die Frage, die vor allem anderen kommt: Brauchen Sie wirklich Fine-Tuning?
#Die Frage, die vor der Installation geklärt werden muss
Ja, ein Modell mit 7 oder 8 Milliarden Parametern lässt sich auf einer Consumer-Grafikkarte fine-tunen: Die Dokumentation von Unsloth nennt für QLoRA mit 4 Bit einen Mindestbedarf von 5 bis 6 GB VRAM. Eine Grafikkarte mit 12 GB ist daher geeignet und bietet Spielraum für Kontext und Batch. Unsloth implementiert die aufwendigen Schritte des LoRA- und QLoRA-Fine-Tunings neu, um laut Anbieter bis zu doppelt so schnell zu sein und dabei 70 % weniger VRAM zu benötigen. Diese Zahlen gelten allerdings nur für bestimmte Notebooks. Das Ergebnis lässt sich als GGUF exportieren, um es in Ollama auszuführen. Die eigentliche Frage stellt sich jedoch vor der Installation: Fine-Tuning verändert das Verhalten eines Modells (Ton, Format, Sprachregister), es aktualisiert aber nicht dessen Wissen. Wenn das Modell Ihre Dokumente kennen soll, bauen Sie zunächst eine Dokumentensuche auf. Rechnen Sie außerdem damit, dass die Vorbereitung des Datensatzes mehr Zeit benötigt als das Training.
Fine-Tuning verändert das Verhalten eines Modells. Die Dokumentensuche verändert, was es zum Zeitpunkt der Antwort weiß. Wer beides verwechselt, verliert Wochen.
| Ihr Bedarf | Die richtige Antwort |
|---|---|
| Antworten basierend auf Ihren Dokumenten | Eine RAG-Pipeline: Die Dokumente können sich täglich ändern |
| Ein einheitliches Ausgabeformat | Fine-Tuning oder Generierung unter vorgegebenen Einschränkungen |
| Ein eigener Ton, eine branchenspezifische Ausdrucksweise | Fine-tuning |
| Das Vokabular eines spezialisierten Fachbereichs | Fine-Tuning mit genügend Beispielen |
| Informationen, die sich häufig ändern | Immer RAG: Für eine Preisangabe neu zu trainieren ergibt keinen Sinn |
| Kürzere oder längere Antworten | Zuerst der Systemprompt; niemals dafür trainieren |
- Fine-tuning oder RAG: detaillierter Entscheidungsbaum
- LoRA und QLoRA: Wie funktioniert das wirklich
- Ein vollständiges Beispiel für LoRA-Fine-Tuning
- Anhand von Zahlen beurteilen, ob ein RAG besser abschneiden würde
#Was Unsloth konkret verändert
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Die Methode ist nicht neu: Die Modellgewichte werden eingefroren, und trainiert werden nur kleine Matrizen, die zu jedem Gewicht hinzugefügt werden – laut dem Unsloth-Leitfaden etwa 1 % der Parameter. LoRA behält das ursprüngliche Modell in 16 Bit bei, QLoRA quantisiert es auf 4 Bit, wodurch 75 % Speicher eingespart werden. Das ist das Standardverfahren und gehört nicht Unsloth.
Der Beitrag der Bibliothek liegt in der Implementierung: Für die rechenintensiven Schritte wurden die Rechenkerne neu geschrieben. Das Projekt gibt es in drei Formen: Unsloth Desktop, eine native Anwendung, Unsloth Studio, eine Weboberfläche, und Unsloth Core, die per Code gesteuerte Version, um die es in diesem Artikel geht. Es wird unter einer Doppellizenz veröffentlicht: Apache 2.0 für den Kern, AGPL-3.0 für bestimmte optionale Komponenten wie die Studio-Oberfläche. Das Projekt gibt an, Sprach-, Diffusions-, Sprachsynthese- und Embedding-Modelle doppelt so schnell mit 70 % weniger VRAM zu trainieren, ohne Genauigkeitsverlust. Bei Mixture-of-Experts-Architekturen (MoE) fällt der veröffentlichte Zugewinn noch größer aus: Bei bestimmten neueren Modellen ist das Training bis zu 12-mal so schnell und spart mehr als 35 % VRAM. Wie alle Leistungsangaben von Anbietern beschreiben diese Zahlen den besten Fall: Das README selbst zeigt, dass „doppelt so schnell, 70 % weniger VRAM“ nur für bestimmte Notebooks gilt.
| Notebook | Angegebene Geschwindigkeit | Angegebener VRAM |
|---|---|---|
| Llama 3.1 (8B) Alpaca | 2 mal mehr schnell | 70 % weniger |
| gpt-oss (20B) | 2 mal mehr schnell | 70 % weniger |
| Qwen3.5 (4B), Vision | 1,5-mal schneller | 60 % weniger |
| Gemma 4 (E2B), Vision | 1,5-mal schneller | 50 % weniger |
| Orpheus-TTS (3B) | 1,5-mal schneller | 50 % weniger |
| embeddinggemma (300M) | 2 mal mehr schnell | 20 % weniger |
#Welche Karte für welches Modell
| Modellgröße | QLoRA (4 Bit) | LoRA (16 Bit) | Einordnung für eine Consumer-Grafikkarte |
|---|---|---|---|
| 3 Milliarden | 3,5 | 8 | Mit QLoRA auf jeder aktuellen Grafikkarte komfortabel nutzbar |
| 7 Milliarden | 5 | 19 | QLoRA mit 8 GB; LoRA mit 16 Bit erfordert eine Karte mit 24 GB |
| 8 Milliarden | 6 | 22 | QLoRA mit 8 GB oder mehr; 12 GB lassen Spielraum |
| 14 Milliarden | 8,5 | 33 | QLoRA mit 12 GB möglich; LoRA mit 16 Bit ist auf einer Karte mit 24 GB nicht möglich |
| 27 Milliarden | 22 | 64 | QLoRA auf 24 GB, ohne Reserven; LoRA mit 16 Bit ist auf einer einzigen Karte nicht möglich |
| 32 Milliarden | 26 | 76 | Über 24 GB, selbst bei QLoRA |
| 70 Milliarden | 41 | 164 | Mit einer Consumer-Grafikkarte nicht machbar |
Die Dokumentation stellt klar, dass diese Werte absolute Mindestwerte sind: Je nach Modell kann mehr Speicher erforderlich sein. Sie nennt eine zu hohe Batchgröße als häufige Ursache für ausgeschöpften Speicher und empfiehlt, sie auf 1, 2 oder 3 zu reduzieren sowie für die ersten Tests eine Kontextlänge von 2048 zu verwenden.
| Plattform | Was die Dokumentation sagt |
|---|---|
| NVIDIA, mit Unsloth Core | Linux und Windows; mindestens Compute Capability 7.0 (V100, T4, RTX 20 und neuere Serien, A100, H100), einschließlich Blackwell und DGX Spark. Die GTX 1070 und 1080 funktionieren, allerdings langsam. |
| AMD und Intel | Eigene Anleitungen; das Training funktioniert auf diesen GPUs sowohl mit Core als auch mit Studio. |
| Mac | Unsloth Studio unterstützt Training, MLX und GGUF-Inferenz (macOS 12 oder neuer). Für Core ist die Unterstützung von Apple Silicon (MLX) als „in Vorbereitung“ angegeben. |
| Ohne GPU | Studio lässt sich für Chats mit GGUF-Modellen und zur Datenvorbereitung nutzen, nicht zum Training. |
| Mehrere GPUs | Unterstützt durch Accelerate und DeepSpeed (FSDP, DDP) mit manueller Einrichtung; die Option device_map="balanced" verteilt ein zu großes Modell auf mehrere Karten. |
#Die eigentliche Arbeit steckt im Datensatz
Ein Fine-Tuning scheitert nie wegen der Bibliothek. Es scheitert wegen der Daten.
- Format
- Meist ein Datensatz mit zwei Spalten, Frage und Antwort, in der vom Modell erwarteten Gesprächsstruktur. Der Leitfaden empfiehlt, von einem Instruct-Modell auszugehen: Es akzeptiert Gesprächsvorlagen (ChatML, ShareGPT) direkt und benötigt weniger Daten als ein Basismodell. Einheitlichkeit zählt mehr als Umfang.
- Umfang
- Der Unsloth-Leitfaden empfiehlt als absolutes Minimum 100 Zeilen und für bessere Ergebnisse mehr als 1.000 Zeilen. Ton und Format lassen sich mit wenigen Beispielen verändern; ein wirklich auf fachliche Aufgaben zugeschnittenes Verhalten erfordert mehr Beispiele, die untereinander konsistent sind.
- Qualität
- Das Modell ahmt nach, was man ihm zeigt, einschließlich der Fehler. Ein systematischer Fehler in den Daten wird zu einem systematischen Fehler des Modells.
- Kontrolldatensatz
- Beispiele, die das Modell während des Trainings nie gesehen hat. Ohne sie ist es unmöglich, das Lernen vom einfachen Auswendiglernen zu unterscheiden.
- Ohne Code
- Unsloth Studio bietet Data Recipes, die PDF-, CSV- oder DOCX-Dateien über einen visuellen Workflow in Datensätze umwandeln und eine Vorschau anzeigen, bevor die vollständige Erstellung gestartet wird.
#Vom Adapter zum nutzbaren Modell
Der Ablauf besteht aus drei Schritten: ein Modell in 4 Bit laden, es mit einem der offiziellen Notebooks trainieren und anschließend exportieren. Der erste Codeblock lädt das Modell und fügt die LoRA-Adapter hinzu; das eigentliche Training übernimmt eines der Unsloth-Notebooks, das Sie laut diesem Leitfaden in Ihre lokale Umgebung kopieren sollten.
Die Endung des Namens ist entscheidend. Laut dem Leitfaden handelt es sich bei einem Modell, dessen Name auf unsloth-bnb-4bit endet, um eine dynamische 4-Bit-Quantisierung von Unsloth: Diese benötigt etwas mehr VRAM als eine standardmäßige BitsAndBytes-Quantisierung, bietet aber eine deutlich höhere Genauigkeit. Ein Name, der nur auf bnb-4bit endet, bezeichnet die Standardversion. Der Leitfaden ergänzt, dass es für Training und Bereitstellung vorteilhaft ist, dieselbe numerische Präzision zu verwenden: Wer das Modell in 4 Bit bereitstellt, trainiert es auch in 4 Bit.
| Parameter | Wert laut Leitfaden | Gut zu wissen |
|---|---|---|
| per_device_train_batch_size | 2 | Größer: bessere Nutzung des GPUs, aber langsamerer Trainingsprozess durch die Auslastung; bevorzugen Sie gradient_accumulation_steps |
| gradient_accumulation_steps | 4 | Simuliert einen größeren Batch ohne zusätzlichen Speicherbedarf |
| max_steps | 60 | Wert für einen schnellen Test; für ein echtes Training durch num_train_epochs mit einem Wert zwischen 1 und 3 ersetzen |
| learning_rate | 2e-4 | Niedriger für ein langsameres und präziseres Fine-Tuning: 1e-4, 5e-5 oder 2e-5 ausprobieren |
| max_seq_length | 2048 | Empfohlene Länge für Tests. Sie höher anzusetzen, „um auf Nummer sicher zu gehen“, reserviert Speicher für Sequenzen, die in Ihren Daten gar nicht vorkommen: Messen Sie zuerst die tatsächliche Länge Ihrer Beispiele |
- 01TrainierenDas Ergebnis ist ein LoRA-Adapter, etwa 100 MB groß im Beispiel von Unsloth, kein vollständiges Modell.
- 02BeurteilenAnhand des Kontrolldatensatzes und im Vergleich zum ursprünglichen Modell. „Besser“ muss nachgewiesen werden und darf nicht einfach angenommen werden. Der Leitfaden weist darauf hin, dass automatische Evaluationswerkzeuge Ihre Kriterien möglicherweise nur unzureichend widerspiegeln.
- 03Zusammenführen oder getrennt haltenDer Adapter kann getrennt bleiben und austauschbar sein oder in die Gewichte integriert werden: model.save_pretrained_merged mit save_method="merged_16bit".
- 04In GGUF exportieren und quantisierenmodel.save_pretrained_gguf erzeugt die Datei mit q4_k_m, q8_0 oder f16 je nach Wahl. Damit ist das Ergebnis für Ollama oder llama.cpp auf normalen Geräten ausführbar.
#Klassische Fallen
- Unwissentlich von einem Basismodell ausgehen
- Der Leitfaden empfiehlt Instruct-Modelle: Sie unterstützen Gesprächsvorlagen und benötigen weniger Daten. Ein Basismodell erfordert ein anderes Format (Alpaca, Vicuna) und mehr Beispiele.
- Die Chatvorlage vergessen
- Formatierte Beispiele, die nicht dem erwarteten Modellformat entsprechen, führen zu einem technisch erfolgreichen, aber praktisch nutzlosen Training.
- Anhand der Trainingsbeispiele messen
- Dieser Fehler führt dazu, dass spektakuläre Ergebnisse angekündigt, aber enttäuschende Modelle geliefert werden.
- Glauben, dass dies die Recherche in Dokumenten ersetzen wird
- Was Sie dem Modell beibringen, veraltet, sobald sich Ihre Informationen ändern, und das Modell nennt seine Quellen nicht. Bei Fakten, die sich ändern, bleibt die Recherche in Dokumenten zuverlässiger.
- Die Bereinigung der Beispiele unterschätzen
- Fast identische Doppelungen in der Datensammlung lenken das Training in Richtung dieser spezifischen Fälle, ohne dass dies in den beobachteten Metriken sichtbar wird.
- Mehrere Einstellungen gleichzeitig ändern
- Die Lernrate, den Adapterrang und die Sequenzlänge im selben Versuch zu ändern, verhindert, dass sich feststellen lässt, welche Einstellung die beobachtete Änderung bewirkt hat.
#Konkrete Anwendungsfälle
- Kundensupport mit einheitlichem Ton
- Ein auf echten Dialogen feinabgestimmtes Modell antwortet in der Stimme der Marke, ohne dass Stilvorgaben in jedem Prompt wiederholt werden müssen.
- Extraktion in einem strikten Format
- Fine-Tuning anhand von Eingabe-Ausgabe-Beispielen legt das Ausgabeformat zuverlässiger fest als ein Prompt allein, was vor der Weitergabe des Ergebnisses an ein nachgelagertes System hilfreich ist.
Diese Fälle haben eines gemeinsam: Jeder lässt sich messen. Bevor Sie ein Training starten, formulieren Sie das Erfolgskriterium in einem überprüfbaren Satz – beispielsweise „Das JSON-Format wird bei mindestens 95 % der Ausgaben für den Kontrolldatensatz eingehalten“ – statt sich auf den allgemeinen Eindruck einer Verbesserung zu verlassen. Dieses Kriterium, nicht die Intuition, zeigt, ob das Ergebnis die investierte Zeit rechtfertigt.
- Quelle: offizielles Unsloth-Repository (Funktionen, Hardware, duale Lizenzierung)
- Quelle: Voraussetzungen und minimaler VRAM-Bedarf nach Modellgröße
- Quelle: Unsloths Leitfaden zum Fine-Tuning
- Quelle: GGUF-Export und Probleme mit dem Template
- Quelle: Leistungszahlen zu MoE-Modellen
#Die tatsächlichen Kosten über den Preis der Grafikkarte hinaus
Die Grafikkarte ist nur ein Aufwandsposten unter vielen. Konsistente Beispiele zu sammeln und zu bereinigen, einen Kontrolldatensatz zu erstellen, den das Modell niemals zu sehen bekommt, und anschließend jede Version mit dem ursprünglichen Modell zu vergleichen, fällt oft stärker ins Gewicht als das Training selbst, das der Unsloth-Leitfaden anhand eines Versuchs mit 60 Schritten veranschaulicht.
Deshalb verkürzt Unsloth die Dauer eines Projekts nicht so stark, wie man es sich erhofft, so schnell es beim Training auch sein mag: Es beseitigt den technischen Engpass, nicht die Arbeit an den Daten.
#FAQ
Ist Unsloth kostenlos?+
Welche Karte benötigt man, um ein 7-Milliarden-Parameter-Modell anzupassen?+
Wie viele Beispiele sind erforderlich?+
Läuft das entstandene Modell in Ollama?+
Funktioniert das mit AMD, auf dem Mac oder ohne GPU?+
Macht Fine-Tuning das Modell zum Experten für meine Daten?+
Empfohlene Hardware: RTX 5070 Ti 16 GB — NVIDIA-Grafikkarte mit 16 GB, ausreichend, um ein 7–8B-Modell mit QLoRA feinzujustieren. Alle KI-Hardware →
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.