Ein GGUF-Modell von Hugging Face importieren in Ollama
Die offizielle Bibliothek von Ollama deckt nur einen Bruchteil der verfügbaren Modelle ab. Auf Hugging Face warten Zehntausende von GGUF-Dateien – Fine-Tunes aus der Community, aktuelle Modelle und noch nicht paketierte Versionen. Dieser Leitfaden zeigt, wie Sie eine beliebige GGUF-Datei von Hugging Face in Ollama importieren: mit dem direkten Befehl ollama run hf.co oder der Modelfile-Methode mit FROM für eine lokale Datei. Außerdem erfahren Sie, wie Sie die Quantisierung passend zu Ihrem VRAM wählen und ein fehlerhaftes Chat-Template reparieren, das zu inkohärenten Antworten führt.
#Warum ein GGUF-Modell von Hugging Face importieren?
Ollama pflegt eine Bibliothek praktischer Modelle (ollama.com/library), doch diese ist bewusst begrenzt: Die Maintainer veröffentlichen dort die am häufigsten nachgefragten Modelle in den jeweils dafür ausgewählten Quantisierungen. Sobald Sie ein spezialisiertes Fine-Tune, eine gerade erschienene Version, ein französischsprachiges Modell oder eine bestimmte Quantisierung suchen, müssen Sie auf Hugging Face danach suchen – der größten Plattform zum Teilen von Open-Weight-Modellen.
Das GGUF-Format (Nachfolger von GGML) wird von Ollama nativ unterstützt: eine einzige Datei, die die quantisierten Gewichte, den Tokenizer und die Metadaten des Modells enthält. Mitwirkende wie TheBloke, bartowski oder unsloth veröffentlichen Tausende einsatzbereiter GGUF-Dateien, oft in etwa zehn Quantisierungen pro Modell. Wenn Sie wissen, wie Sie diese importieren, steht Ihnen dieses gesamte Ökosystem in Ihrer Ollama-Installation zur Verfügung.
- Neue Modelle
- Ein Modell, das gestern auf Hugging Face veröffentlicht wurde, ist bereits vor dem Erscheinen in der offiziellen Bibliothek von Ollama nutzbar.
- Nischen-Fine-Tunes
- Spezialisierte Modelle (Code, Medizin, Rollenspiel, Französisch), für die sich niemand die Mühe gemacht hat, sie offiziell zu paketieren.
- Präzise Quantisierung
- Genau die Quantisierungsstufe (Q4_K_M, Q5_K_M, Q8_0…) auswählen, die in Ihren VRAM passt, statt nur die Standardvariante zu verwenden.
- Private Modelle
- Ihre eigenen Fine-tunes oder heruntergeladenen GGUF-Modelle, lokal importiert über ein Modelfile.
#Voraussetzungen
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
- Ollama installiert
- Aktuelle Version (0.5+) für die native Unterstützung von hf.co. Der Daemon lauscht standardmäßig auf http://localhost:11434. Prüfen Sie die Version mit „ollama --version“.
- Eine Internetverbindung
- Für die direkte Methode, bei der das Modell von Hugging Face heruntergeladen wird. Danach läuft das Modell zu 100 % lokal.
- Genügend VRAM oder RAM
- Richtwerte für Q4: Ein 7B passt in ~5 GB, ein 14B in ~9 GB, ein 32B in ~19 GB, ein 70B in ~40 GB. Ohne GPU kommt es auf den RAM an, allerdings läuft das Modell dann langsamer.
- Der Name eines GGUF-Repositorys
- Zum Beispiel bartowski/Qwen3.5-9B-Instruct-GGUF. Finden Sie ihn in der URL der Hugging Face-Seite des Modells.
Um ein GGUF-Repository zu finden, können Sie die Hugging-Face-Suche nach Format filtern. Suchen Sie nach dem Modellnamen und ergänzen Sie „GGUF“, oder filtern Sie in der Seitenleiste nach der Bibliothek „GGUF“. Öffnen Sie die Registerkarte „Files and versions“: Dort finden Sie die Liste der .gguf-Dateien, eine pro Quantisierung, jeweils mit ihrer Größe in GB — eine wertvolle Information für die nächsten Schritte.
#Direkte Methode: ollama run hf.co/...
Das ist mit Abstand die einfachste Möglichkeit, ein GGUF-Modell von Hugging Face in Ollama zu importieren. Seit Version 0.5 kann Ollama ein GGUF-Modell mit einem einzigen Befehl direkt aus einem Hugging-Face-Repository abrufen, ohne die Datei manuell herunterzuladen oder ein Modelfile zu schreiben. Die Syntax verwendet den Repository-Pfad mit dem Präfix hf.co/.
Ohne ausdrückliche Angabe wählt Ollama eine Standardquantisierung (in der Regel Q4_K_M, sofern sie im Repository vorhanden ist). Um eine bestimmte Quantisierung auszuwählen, fügen Sie sie nach einem Doppelpunkt hinzu, genau wie bei einem normalen Modell-Tag. Der Tagname entspricht dem Suffix der .gguf-Datei; Groß- und Kleinschreibung spielen dabei keine Rolle.
Ollama lädt die Datei herunter, legt sie in seinem lokalen Speicher ab und startet das Gespräch. Das Modell erscheint anschließend in « ollama list » unter seinem vollständigen Namen hf.co/... und lässt sich sofort wieder starten. Sie können ihm mit « ollama cp » einen kürzeren Alias geben, wenn Ihnen der Name zum Eintippen zu lang erscheint.
#Die passende Quantisierung für den verfügbaren VRAM wählen
Dasselbe Modell wird in mehreren Quantisierungen veröffentlicht: Das ist der zentrale Kompromiss zwischen Qualität und Speicherbedarf. Je aggressiver die Quantisierung ist (weniger Bits pro Gewicht), desto kleiner ist die Datei und desto eher passt sie auf eine weniger leistungsfähige Grafikkarte – auf Kosten eines leichten Präzisionsverlusts. Wählen Sie am besten die höchste Quantisierungsstufe, die mit ausreichend Spielraum in Ihren VRAM passt.
- Q4_K_M — empfohlen
- Der beste Kompromiss für die große Mehrheit der Anwendungsfälle. Nahezu unmerklicher Qualitätsverlust, reduzierter Speicherbedarf. Bei Unsicherheit als Standard wählen.
- Q5_K_M — eine Stufe höher
- Etwas höherer Speicherbedarf, etwas höhere Genauigkeit. Interessant, wenn Ihr VRAM noch Reserven hat und Sie die höchstmögliche Qualität wünschen, ohne auf 8 Bit umzusteigen.
- Q8_0 — fast ohne Verlust
- Sehr nah am nicht quantisierten Modell, benötigt aber etwa doppelt so viel Speicher wie Q4. Nur für Fälle, in denen selbst die geringste Qualitätseinbuße zählt und ausreichend VRAM vorhanden ist.
- FP16 — volle Präzision
- Das nicht quantisierte Modell mit dem größten Speicherbedarf. Für lokale Inferenz selten nötig: Q8_0 reicht fast immer aus und halbiert den Speicherbedarf.
Um abzuschätzen, ob ein quantisiertes Modell in den Speicher passt, orientieren Sie sich an der auf Hugging Face angegebenen Größe der .gguf-Datei und rechnen Sie etwa 1 bis 2 GB Reserve für den Kontext und das System hinzu. Hier finden Sie VRAM-Richtwerte für Q4_K_M nach Modellgröße sowie typische GPUs, auf denen diese Modelle laufen.
- 3B ≈ 2 GB
- Läuft überall, selbst auf einer Einsteiger-Grafikkarte oder auf der CPU. Ideal für die RTX 3060 mit 12 GB, mit reichlich Spielraum für den Kontext.
- 7B ≈ 5 GB
- Läuft problemlos auf einer RTX 3060 mit 12 GB oder einer RTX 4070 mit 12 GB. Das vielseitigste Format für den täglichen Gebrauch.
- 14B ≈ 9 GB
- RTX 4070 mit 12 GB (knapp), RTX 4080 mit 16 GB mit ausreichend Spielraum. Eine gute Qualitätsstufe für logisches Schlussfolgern und Programmieren.
- 32B ≈ 19 GB
- RTX 4090 mit 24 GB oder Mac M4 Pro mit gemeinsamem Speicher. Erschwingliche Spitzenklasse für den Arbeitsplatzrechner.
- 70B ≈ 40 GB
- Benötigt mindestens 48 GB: einen Mac Studio mit großem gemeinsamem Speicher oder mehrere GPUs. Wechseln Sie zu Q4 oder einer noch aggressiveren Quantisierung.
#Modelfile-Methode: FROM fichier.gguf
Die direkte Methode setzt voraus, dass die GGUF-Datei auf Hugging Face liegt und online zugänglich ist. Wenn Sie jedoch bereits eine .gguf-Datei manuell heruntergeladen, mit llama.cpp eine eigene erstellt haben oder das Modell anpassen möchten (System-Prompt, Parameter), müssen Sie ein Modelfile verwenden. Das ist eine kleine Textdatei, ähnlich einem Dockerfile, die beschreibt, wie ein Ollama-Modell aus einer lokalen GGUF-Datei erstellt wird.
Die zentrale Anweisung ist FROM, die auf den Pfad zur .gguf-Datei zeigt. Erstellen Sie eine Datei namens „Modelfile“ (ohne Erweiterung) neben Ihrer GGUF-Datei mit mindestens dieser Zeile.
Erstellen Sie anschließend das Modell mit „ollama create“ und geben Sie ihm einen Namen Ihrer Wahl. Ollama liest die GGUF-Datei, legt sie in seinem eigenen Speicher ab und stellt das Modell wie jedes andere Modell bereit.
Ein vollständiges Modelfile kann noch viel mehr: einen Systemprompt festlegen, die Sampling-Parameter einstellen und vor allem TEMPLATE definieren — das vom Modell erwartete Chatformat. Hier lassen sich die meisten Qualitätsprobleme beheben, wie der folgende Abschnitt zeigt.
#Ein defektes Chat-Template reparieren
Das ist die häufigste Falle beim Import von GGUF-Modellen. Ein importiertes Modell kann völlig unsinnige Antworten liefern: Sätze, die nie enden, seltsame Tags in der Ausgabe (<|im_end|>, [INST], <end_of_turn>), Antworten, die die Frage ignorieren oder in Endlosschleifen geraten. In neun von zehn Fällen ist nicht das Modell schlecht – vielmehr stimmt das Chat-Template nicht mit dem beim Training verwendeten überein.
Jede Modellfamilie erwartet ein bestimmtes Gesprächsformat: ChatML (<|im_start|>) für Qwen und viele Fine-Tunes, [INST]...[/INST] für Mistral und Llama 2, <start_of_turn> für Gemma und ein eigenes Format für Llama 3. Wenn die GGUF-Datei die falsche Vorlage in ihren Metadaten enthält oder Ollama eine falsche Vorlage vermutet, verschlechtert sich die Qualität der Antworten. Das häufigste Symptom: Markierungen für das Ende eines Gesprächsbeitrags erscheinen als Klartext in der Antwort, statt die Generierung zu stoppen.
- Symptom: sichtbare Tags
- Das Modell zeigt <|im_end|> oder <|eot_id|> in seiner Antwort. Es fehlt ein entsprechender PARAMETER stop, oder das Template gibt nicht das richtige Endtoken aus.
- Symptom: unendliche Generierung
- Das Modell hört nie auf zu generieren und setzt die Gesprächsrunden von selbst fort. Das erwartete Stopptoken ist nicht deklariert.
- Symptom: inkonsistente Antworten
- Das Modell ignoriert den System-Prompt oder antwortet an der Frage vorbei. Das Rollenformat (system/user/assistant) entspricht nicht dem Format aus dem Training.
Die Lösung besteht darin, in einem Modelfile die passende TEMPLATE-Anweisung und die richtigen PARAMETER stop-Anweisungen anzugeben. Maßgeblich ist die „model card“ des ursprünglichen Modells auf Hugging Face: Suchen Sie den Abschnitt „prompt format“ oder „chat template“, der das genaue Format angibt. Bei einem ChatML-Modell (Qwen und davon abgeleitete Modelle) sehen das Template und die Stop-Sequenzen etwa so aus.
Erstellen Sie das Modell anschließend mit „ollama create“ neu und testen Sie es. Ein wirksamer Trick, um das passende Template zu erhalten, ohne es neu zu schreiben: Gehen Sie von einem offiziellen Modell derselben Familie aus, das bereits in Ollama vorhanden ist, sehen Sie sich dessen generiertes Modelfile an und übernehmen Sie daraus den TEMPLATE-Block.
#Fehlerbehebung
- „Error: pull model manifest“
- Der hf.co-Pfad ist falsch geschrieben, das Repository ist privat oder zugangsbeschränkt, oder Ihre Ollama-Version ist zu alt. Überprüfen Sie die genaue URL des Repositorys und aktualisieren Sie Ollama.
- Der Quantisierungs-Tag existiert nicht
- Ollama meldet, dass der Tag nicht gefunden wurde: Öffnen Sie „Files and versions“ auf Hugging Face und kopieren Sie das genaue Suffix der .gguf-Datei (z. B. Q4_K_M, IQ4_XS). Die Groß- und Kleinschreibung wird nicht berücksichtigt, aber der Name muss übereinstimmen.
- Sehr langsames Modell / stockende Antworten
- Das Modell wird wegen unzureichenden VRAMs teilweise in den RAM ausgelagert und auf der CPU ausgeführt. Prüfen Sie mit „ollama ps“, ob es auf der GPU oder der CPU läuft, und wechseln Sie zu einer Quantisierung mit geringerer Bitbreite oder zu einem kleineren Modell.
- Das Repository enthält nur safetensors
- Keine .gguf-Datei verfügbar: Suchen Sie nach einer von der Community konvertierten „GGUF“-Version oder konvertieren Sie das Modell selbst mit den Skripten von llama.cpp.
- Ausgaben mit störenden Tags
- Falsches Chat-Template: Lesen Sie den vorherigen Abschnitt und geben Sie das richtige TEMPLATE sowie die PARAMETER stop über ein Modelfile an.
#Weiterführende Informationen
Der Import einer GGUF-Datei setzt zwei grundlegende Kenntnisse im Ollama-Ökosystem voraus. Diese Anleitungen auf unserer Website führen diesen Leitfaden weiter:
- Quantisierung wählen (Q4, Q5, Q8, FP16)
- Den Kompromiss zwischen Qualität und Speicherbedarf im Detail verstehen, um die passende GGUF-Variante für Ihre Grafikkarte auszuwählen.
- Ein Modell mit Ollama Modelfile anpassen
- Mit dem Modelfile weiter ins Detail gehen: System-Prompts, Parameter, Templates und mehrere Varianten desselben Modells.
- Ollama installieren: Windows, macOS und Linux
- Der aktuelle Leitfaden zur grundlegenden Installation, wenn Sie bei null anfangen, bevor Sie Ihre ersten GGUF-Dateien importieren.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.