Mittelstufe 9 Min.Ollama

Ein GGUF-Modell von Hugging Face importieren in Ollama

Die offizielle Bibliothek von Ollama deckt nur einen Bruchteil der verfügbaren Modelle ab. Auf Hugging Face warten Zehntausende von GGUF-Dateien – Fine-Tunes aus der Community, aktuelle Modelle und noch nicht paketierte Versionen. Dieser Leitfaden zeigt, wie Sie eine beliebige GGUF-Datei von Hugging Face in Ollama importieren: mit dem direkten Befehl ollama run hf.co oder der Modelfile-Methode mit FROM für eine lokale Datei. Außerdem erfahren Sie, wie Sie die Quantisierung passend zu Ihrem VRAM wählen und ein fehlerhaftes Chat-Template reparieren, das zu inkohärenten Antworten führt.

Von Marie L.·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum ein GGUF-Modell von Hugging Face importieren?

Ollama pflegt eine Bibliothek praktischer Modelle (ollama.com/library), doch diese ist bewusst begrenzt: Die Maintainer veröffentlichen dort die am häufigsten nachgefragten Modelle in den jeweils dafür ausgewählten Quantisierungen. Sobald Sie ein spezialisiertes Fine-Tune, eine gerade erschienene Version, ein französischsprachiges Modell oder eine bestimmte Quantisierung suchen, müssen Sie auf Hugging Face danach suchen – der größten Plattform zum Teilen von Open-Weight-Modellen.

Das GGUF-Format (Nachfolger von GGML) wird von Ollama nativ unterstützt: eine einzige Datei, die die quantisierten Gewichte, den Tokenizer und die Metadaten des Modells enthält. Mitwirkende wie TheBloke, bartowski oder unsloth veröffentlichen Tausende einsatzbereiter GGUF-Dateien, oft in etwa zehn Quantisierungen pro Modell. Wenn Sie wissen, wie Sie diese importieren, steht Ihnen dieses gesamte Ökosystem in Ihrer Ollama-Installation zur Verfügung.

Neue Modelle
Ein Modell, das gestern auf Hugging Face veröffentlicht wurde, ist bereits vor dem Erscheinen in der offiziellen Bibliothek von Ollama nutzbar.
Nischen-Fine-Tunes
Spezialisierte Modelle (Code, Medizin, Rollenspiel, Französisch), für die sich niemand die Mühe gemacht hat, sie offiziell zu paketieren.
Präzise Quantisierung
Genau die Quantisierungsstufe (Q4_K_M, Q5_K_M, Q8_0…) auswählen, die in Ihren VRAM passt, statt nur die Standardvariante zu verwenden.
Private Modelle
Ihre eigenen Fine-tunes oder heruntergeladenen GGUF-Modelle, lokal importiert über ein Modelfile.
i
GGUF, GGML, safetensors?
Ollama liest GGUF, nicht safetensors (das PyTorch-Trainingsformat). Wenn ein Repository nur .safetensors enthält, muss das Modell zunächst mit llama.cpp in GGUF konvertiert werden – oder Sie suchen eine bereits von der Community konvertierte „GGUF“-Version (geben Sie den Modellnamen + „GGUF“ in die Suche auf Hugging Face ein).

#Voraussetzungen

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen
Ollama installiert
Aktuelle Version (0.5+) für die native Unterstützung von hf.co. Der Daemon lauscht standardmäßig auf http://localhost:11434. Prüfen Sie die Version mit „ollama --version“.
Eine Internetverbindung
Für die direkte Methode, bei der das Modell von Hugging Face heruntergeladen wird. Danach läuft das Modell zu 100 % lokal.
Genügend VRAM oder RAM
Richtwerte für Q4: Ein 7B passt in ~5 GB, ein 14B in ~9 GB, ein 32B in ~19 GB, ein 70B in ~40 GB. Ohne GPU kommt es auf den RAM an, allerdings läuft das Modell dann langsamer.
Der Name eines GGUF-Repositorys
Zum Beispiel bartowski/Qwen3.5-9B-Instruct-GGUF. Finden Sie ihn in der URL der Hugging Face-Seite des Modells.

Um ein GGUF-Repository zu finden, können Sie die Hugging-Face-Suche nach Format filtern. Suchen Sie nach dem Modellnamen und ergänzen Sie „GGUF“, oder filtern Sie in der Seitenleiste nach der Bibliothek „GGUF“. Öffnen Sie die Registerkarte „Files and versions“: Dort finden Sie die Liste der .gguf-Dateien, eine pro Quantisierung, jeweils mit ihrer Größe in GB — eine wertvolle Information für die nächsten Schritte.

#Direkte Methode: ollama run hf.co/...

Das ist mit Abstand die einfachste Möglichkeit, ein GGUF-Modell von Hugging Face in Ollama zu importieren. Seit Version 0.5 kann Ollama ein GGUF-Modell mit einem einzigen Befehl direkt aus einem Hugging-Face-Repository abrufen, ohne die Datei manuell herunterzuladen oder ein Modelfile zu schreiben. Die Syntax verwendet den Repository-Pfad mit dem Präfix hf.co/.

Terminal — ein GGUF von Hugging Face starten
# Format : ollama run hf.co/{utilisateur}/{depot}
ollama run hf.co/bartowski/Qwen3.5-9B-Instruct-GGUF

Ohne ausdrückliche Angabe wählt Ollama eine Standardquantisierung (in der Regel Q4_K_M, sofern sie im Repository vorhanden ist). Um eine bestimmte Quantisierung auszuwählen, fügen Sie sie nach einem Doppelpunkt hinzu, genau wie bei einem normalen Modell-Tag. Der Tagname entspricht dem Suffix der .gguf-Datei; Groß- und Kleinschreibung spielen dabei keine Rolle.

Terminal – Quantisierung auswählen
# Choisir explicitement Q5_K_M
ollama run hf.co/bartowski/Qwen3.5-9B-Instruct-GGUF:Q5_K_M

# Ou une version plus légère pour une petite carte
ollama run hf.co/bartowski/Qwen3.5-9B-Instruct-GGUF:Q4_K_M

Ollama lädt die Datei herunter, legt sie in seinem lokalen Speicher ab und startet das Gespräch. Das Modell erscheint anschließend in « ollama list » unter seinem vollständigen Namen hf.co/... und lässt sich sofort wieder starten. Sie können ihm mit « ollama cp » einen kürzeren Alias geben, wenn Ihnen der Name zum Eintippen zu lang erscheint.

Terminal — Namen kürzen
# Copier vers un alias court
ollama cp hf.co/bartowski/Qwen3.5-9B-Instruct-GGUF:Q4_K_M qwen-fr

# Désormais utilisable simplement
ollama run qwen-fr
→
Private oder zugangsbeschränkte Repositories
Authentifizieren Sie sich zunächst bei einem privaten Repository oder einem Repository mit Zugangsbeschränkungen (gated). Fügen Sie Ihren Hugging-Face-Schlüssel auf der Website zu Ihren SSH-Schlüsseln hinzu oder exportieren Sie ein Zugriffstoken. Die meisten öffentlichen GGUF-Dateien aus der Community erfordern keine Authentifizierung.

#Die passende Quantisierung für den verfügbaren VRAM wählen

Dasselbe Modell wird in mehreren Quantisierungen veröffentlicht: Das ist der zentrale Kompromiss zwischen Qualität und Speicherbedarf. Je aggressiver die Quantisierung ist (weniger Bits pro Gewicht), desto kleiner ist die Datei und desto eher passt sie auf eine weniger leistungsfähige Grafikkarte – auf Kosten eines leichten Präzisionsverlusts. Wählen Sie am besten die höchste Quantisierungsstufe, die mit ausreichend Spielraum in Ihren VRAM passt.

Q4_K_M — empfohlen
Der beste Kompromiss für die große Mehrheit der Anwendungsfälle. Nahezu unmerklicher Qualitätsverlust, reduzierter Speicherbedarf. Bei Unsicherheit als Standard wählen.
Q5_K_M — eine Stufe höher
Etwas höherer Speicherbedarf, etwas höhere Genauigkeit. Interessant, wenn Ihr VRAM noch Reserven hat und Sie die höchstmögliche Qualität wünschen, ohne auf 8 Bit umzusteigen.
Q8_0 — fast ohne Verlust
Sehr nah am nicht quantisierten Modell, benötigt aber etwa doppelt so viel Speicher wie Q4. Nur für Fälle, in denen selbst die geringste Qualitätseinbuße zählt und ausreichend VRAM vorhanden ist.
FP16 — volle Präzision
Das nicht quantisierte Modell mit dem größten Speicherbedarf. Für lokale Inferenz selten nötig: Q8_0 reicht fast immer aus und halbiert den Speicherbedarf.

Um abzuschätzen, ob ein quantisiertes Modell in den Speicher passt, orientieren Sie sich an der auf Hugging Face angegebenen Größe der .gguf-Datei und rechnen Sie etwa 1 bis 2 GB Reserve für den Kontext und das System hinzu. Hier finden Sie VRAM-Richtwerte für Q4_K_M nach Modellgröße sowie typische GPUs, auf denen diese Modelle laufen.

3B ≈ 2 GB
Läuft überall, selbst auf einer Einsteiger-Grafikkarte oder auf der CPU. Ideal für die RTX 3060 mit 12 GB, mit reichlich Spielraum für den Kontext.
7B ≈ 5 GB
Läuft problemlos auf einer RTX 3060 mit 12 GB oder einer RTX 4070 mit 12 GB. Das vielseitigste Format für den täglichen Gebrauch.
14B ≈ 9 GB
RTX 4070 mit 12 GB (knapp), RTX 4080 mit 16 GB mit ausreichend Spielraum. Eine gute Qualitätsstufe für logisches Schlussfolgern und Programmieren.
32B ≈ 19 GB
RTX 4090 mit 24 GB oder Mac M4 Pro mit gemeinsamem Speicher. Erschwingliche Spitzenklasse für den Arbeitsplatzrechner.
70B ≈ 40 GB
Benötigt mindestens 48 GB: einen Mac Studio mit großem gemeinsamem Speicher oder mehrere GPUs. Wechseln Sie zu Q4 oder einer noch aggressiveren Quantisierung.
!
Gehen Sie nicht ohne Grund unter Q4
Mit den Quantisierungen Q3, Q2 oder IQ2 passen große Modelle in wenig VRAM, doch der Qualitätsverlust wird deutlich spürbar (weniger kohärente Antworten, Fehler beim logischen Schlussfolgern). Auf derselben Karte ist ein 7B-Modell in Q4_K_M einem 14B-Modell in Q2 vorzuziehen. Der Leitfaden zur Quantisierung erläutert diese Abwägungen im Detail.

#Modelfile-Methode: FROM fichier.gguf

Die direkte Methode setzt voraus, dass die GGUF-Datei auf Hugging Face liegt und online zugänglich ist. Wenn Sie jedoch bereits eine .gguf-Datei manuell heruntergeladen, mit llama.cpp eine eigene erstellt haben oder das Modell anpassen möchten (System-Prompt, Parameter), müssen Sie ein Modelfile verwenden. Das ist eine kleine Textdatei, ähnlich einem Dockerfile, die beschreibt, wie ein Ollama-Modell aus einer lokalen GGUF-Datei erstellt wird.

Die zentrale Anweisung ist FROM, die auf den Pfad zur .gguf-Datei zeigt. Erstellen Sie eine Datei namens „Modelfile“ (ohne Erweiterung) neben Ihrer GGUF-Datei mit mindestens dieser Zeile.

Modelfile — minimal
FROM ./mon-modele.Q4_K_M.gguf

Erstellen Sie anschließend das Modell mit „ollama create“ und geben Sie ihm einen Namen Ihrer Wahl. Ollama liest die GGUF-Datei, legt sie in seinem eigenen Speicher ab und stellt das Modell wie jedes andere Modell bereit.

Terminal — erstellen und starten
# Construire le modèle depuis le Modelfile du dossier courant
ollama create mon-modele -f ./Modelfile

# Le lancer
ollama run mon-modele

Ein vollständiges Modelfile kann noch viel mehr: einen Systemprompt festlegen, die Sampling-Parameter einstellen und vor allem TEMPLATE definieren — das vom Modell erwartete Chatformat. Hier lassen sich die meisten Qualitätsprobleme beheben, wie der folgende Abschnitt zeigt.

Modelfile — vollständig
FROM ./mon-modele.Q4_K_M.gguf

# System prompt par défaut
SYSTEM """Tu es un assistant francophone concis et précis."""

# Paramètres d'inférence
PARAMETER temperature 0.7
PARAMETER top_p 0.9
PARAMETER num_ctx 8192
PARAMETER stop "<|im_end|>"

# Template de chat (exemple format ChatML)
TEMPLATE """{{ if .System }}<|im_start|>system
{{ .System }}<|im_end|>
{{ end }}{{ if .Prompt }}<|im_start|>user
{{ .Prompt }}<|im_end|>
{{ end }}<|im_start|>assistant
{{ .Response }}<|im_end|>
"""
i
Ein GGUF, mehrere Varianten
Das Modelfile ist auch eine saubere Möglichkeit, mehrere Assistenten aus derselben GGUF-Datei abzuleiten: einen „Übersetzer“, einen „Programmierer“, einen „FR-Assistenten“, jeweils mit eigenem System-Prompt und eigenen Parametern, ohne die Gewichtsdatei zu duplizieren. Der Modelfile-Leitfaden dieser Website beschreibt diesen Workflow im Detail.

#Ein defektes Chat-Template reparieren

Das ist die häufigste Falle beim Import von GGUF-Modellen. Ein importiertes Modell kann völlig unsinnige Antworten liefern: Sätze, die nie enden, seltsame Tags in der Ausgabe (<|im_end|>, [INST], <end_of_turn>), Antworten, die die Frage ignorieren oder in Endlosschleifen geraten. In neun von zehn Fällen ist nicht das Modell schlecht – vielmehr stimmt das Chat-Template nicht mit dem beim Training verwendeten überein.

Jede Modellfamilie erwartet ein bestimmtes Gesprächsformat: ChatML (<|im_start|>) für Qwen und viele Fine-Tunes, [INST]...[/INST] für Mistral und Llama 2, <start_of_turn> für Gemma und ein eigenes Format für Llama 3. Wenn die GGUF-Datei die falsche Vorlage in ihren Metadaten enthält oder Ollama eine falsche Vorlage vermutet, verschlechtert sich die Qualität der Antworten. Das häufigste Symptom: Markierungen für das Ende eines Gesprächsbeitrags erscheinen als Klartext in der Antwort, statt die Generierung zu stoppen.

Symptom: sichtbare Tags
Das Modell zeigt <|im_end|> oder <|eot_id|> in seiner Antwort. Es fehlt ein entsprechender PARAMETER stop, oder das Template gibt nicht das richtige Endtoken aus.
Symptom: unendliche Generierung
Das Modell hört nie auf zu generieren und setzt die Gesprächsrunden von selbst fort. Das erwartete Stopptoken ist nicht deklariert.
Symptom: inkonsistente Antworten
Das Modell ignoriert den System-Prompt oder antwortet an der Frage vorbei. Das Rollenformat (system/user/assistant) entspricht nicht dem Format aus dem Training.

Die Lösung besteht darin, in einem Modelfile die passende TEMPLATE-Anweisung und die richtigen PARAMETER stop-Anweisungen anzugeben. Maßgeblich ist die „model card“ des ursprünglichen Modells auf Hugging Face: Suchen Sie den Abschnitt „prompt format“ oder „chat template“, der das genaue Format angibt. Bei einem ChatML-Modell (Qwen und davon abgeleitete Modelle) sehen das Template und die Stop-Sequenzen etwa so aus.

Modelfile — ein ChatML-Template reparieren
FROM ./mon-modele.Q4_K_M.gguf

TEMPLATE """{{ if .System }}<|im_start|>system
{{ .System }}<|im_end|>
{{ end }}{{ if .Prompt }}<|im_start|>user
{{ .Prompt }}<|im_end|>
{{ end }}<|im_start|>assistant
{{ .Response }}<|im_end|>
"""

PARAMETER stop "<|im_start|>"
PARAMETER stop "<|im_end|>"

Erstellen Sie das Modell anschließend mit „ollama create“ neu und testen Sie es. Ein wirksamer Trick, um das passende Template zu erhalten, ohne es neu zu schreiben: Gehen Sie von einem offiziellen Modell derselben Familie aus, das bereits in Ollama vorhanden ist, sehen Sie sich dessen generiertes Modelfile an und übernehmen Sie daraus den TEMPLATE-Block.

Terminal — ein vorhandenes Template abrufen
# Voir le Modelfile complet d'un modèle officiel de la même famille
ollama show --modelfile qwen3.5:9b

# Copiez-en le bloc TEMPLATE et les PARAMETER stop
# dans votre propre Modelfile, puis reconstruisez
ollama create mon-modele -f ./Modelfile
→
Prüfen Sie zuerst die übernommene Vorlage
Bevor Sie alles neu schreiben, führen Sie „ollama show --modelfile hf.co/...“ für Ihr importiertes Modell aus: Ollama zeigt das Template an, das es aus der GGUF-Datei abgeleitet hat. Ist es korrekt, müssen Sie es nicht neu erstellen; fehlt es oder ist es falsch, wissen Sie, was Sie korrigieren müssen. Vergleichen Sie es immer mit der ursprünglichen Model Card.

#Fehlerbehebung

„Error: pull model manifest“
Der hf.co-Pfad ist falsch geschrieben, das Repository ist privat oder zugangsbeschränkt, oder Ihre Ollama-Version ist zu alt. Überprüfen Sie die genaue URL des Repositorys und aktualisieren Sie Ollama.
Der Quantisierungs-Tag existiert nicht
Ollama meldet, dass der Tag nicht gefunden wurde: Öffnen Sie „Files and versions“ auf Hugging Face und kopieren Sie das genaue Suffix der .gguf-Datei (z. B. Q4_K_M, IQ4_XS). Die Groß- und Kleinschreibung wird nicht berücksichtigt, aber der Name muss übereinstimmen.
Sehr langsames Modell / stockende Antworten
Das Modell wird wegen unzureichenden VRAMs teilweise in den RAM ausgelagert und auf der CPU ausgeführt. Prüfen Sie mit „ollama ps“, ob es auf der GPU oder der CPU läuft, und wechseln Sie zu einer Quantisierung mit geringerer Bitbreite oder zu einem kleineren Modell.
Das Repository enthält nur safetensors
Keine .gguf-Datei verfügbar: Suchen Sie nach einer von der Community konvertierten „GGUF“-Version oder konvertieren Sie das Modell selbst mit den Skripten von llama.cpp.
Ausgaben mit störenden Tags
Falsches Chat-Template: Lesen Sie den vorherigen Abschnitt und geben Sie das richtige TEMPLATE sowie die PARAMETER stop über ein Modelfile an.

#Weiterführende Informationen

Der Import einer GGUF-Datei setzt zwei grundlegende Kenntnisse im Ollama-Ökosystem voraus. Diese Anleitungen auf unserer Website führen diesen Leitfaden weiter:

Quantisierung wählen (Q4, Q5, Q8, FP16)
Den Kompromiss zwischen Qualität und Speicherbedarf im Detail verstehen, um die passende GGUF-Variante für Ihre Grafikkarte auszuwählen.
Ein Modell mit Ollama Modelfile anpassen
Mit dem Modelfile weiter ins Detail gehen: System-Prompts, Parameter, Templates und mehrere Varianten desselben Modells.
Ollama installieren: Windows, macOS und Linux
Der aktuelle Leitfaden zur grundlegenden Installation, wenn Sie bei null anfangen, bevor Sie Ihre ersten GGUF-Dateien importieren.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.