Einsteiger 11 Min.Konzepte

Hugging Face: Was ist das und wie verwendet man es ?

Direkte Antwort

Hugging Face ist die Plattform, auf der fast alle offenen KI-Modelle veröffentlicht werden: Qwen, Llama, Gemma, Mistral, gpt-oss, DeepSeek. Sie wird oft als das GitHub des maschinellen Lernens beschrieben: das zentrale Archiv, aus dem die Dateien stammen, einschließlich derjenigen, die Ollama und LM Studio für Sie herunterladen. Am 18. August 2026 überschritt der Hub die Marke von drei Millionen öffentlichen Modellen, ohne jegliche redaktionelle Auswahl.

Hugging Face ist die Plattform, auf der fast alle offenen KI-Modelle veröffentlicht werden: Qwen, Llama, Gemma, Mistral, gpt-oss, DeepSeek. Sie wird oft als das GitHub des maschinellen Lernens beschrieben. Wer eine KI auf dem eigenen Rechner betreibt, bezieht von dort sämtliche Dateien, einschließlich derer, die Ollama und LM Studio für Sie herunterladen. Der Hub hat am 18. August 2026 offiziell die Marke von drei Millionen öffentlichen Modellen überschritten, bei etwa 2.700 bis 3.000 neuen Modellen pro Tag und ohne jegliche Vorauswahl. Diese Seite zeigt Ihnen, wie Sie sich dort zurechtfinden: welches Repository Sie öffnen, welche Datei Sie für Ihre Grafikkarte auswählen und was Sie vor dem Klicken überprüfen sollten.

Von Mohamed Meguedmi·Aktualisierung 2026-09-28·Unter Windows, macOS und Linux getestet

#Was ist Hugging Face?

Hugging Face ist ein Unternehmen, das 2016 von den drei französischen Unternehmern Clément Delangue, Julien Chaumond und Thomas Wolf gegründet wurde. Es ist in New York und Paris ansässig, wobei sein Hauptsitz weiterhin in den Vereinigten Staaten liegt. Angefangen hat es mit einer Chatbot-App für Jugendliche, einem inzwischen aufgegebenen Projekt. Daher stammt auch der Name, der dem lächelnden Emoji mit offenen Händen entlehnt ist. Anschließend wandte sich das Unternehmen Open-Source-Werkzeugen für maschinelles Lernen zu: Seine Bibliothek transformers ist praktisch zum Standard geworden, um Sprachmodelle in Python zu laden und auszuführen, und wird von den meisten Forschungslabors und Unternehmen der Branche genutzt. Schließlich entwickelte das Unternehmen den Hub, eine Hosting-Plattform auf Basis des Versionsverwaltungssystems Git, auf der jeder kostenlos Modelle, Datensätze und kleine Web-Demos veröffentlichen kann, ohne vorherige redaktionelle Prüfung.

Für lokale KI übernimmt der Hub die Rolle eines App-Stores, mit zwei Unterschieden: Fast alles ist kostenlos, und nichts wird für Sie ausgewählt. Anders als in einem klassischen App-Store testet, genehmigt oder ordnet niemand die Modelle vor ihrer Veröffentlichung ein: Jeder kann ein kostenloses Konto erstellen und innerhalb weniger Minuten ein Repository hochladen, ohne jegliche Prüfung oder Qualitätskontrolle. Dieses völlige Fehlen von Filtern ist zugleich die Stärke des Hubs – alles erscheint dort zuerst, oft noch vor der offiziellen Ankündigung eines Labors – und seine größte Falle für Einsteiger, die vor Hunderten von Suchergebnissen stehen können, ohne zu wissen, welches verlässlich ist. Sich zurechtzufinden, ein offizielles Repository von einer Kopie eines Drittanbieters und eine seriöse Konvertierung von einem aufgegebenen Versuch zu unterscheiden, ist die Fähigkeit, die man erwerben sollte, bevor man irgendetwas herunterlädt.

#Die drei Bereiche des Hubs

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen
BereichInhaltNutzen für lokale KI
ModelsGewichtsdateien, Konfiguration, DokumentationHier befindet sich die Datei, die Sie ausführen werden
DatasetsTrainings- und BewertungsdatenNur bei Fine-Tuning oder Tests
SpacesKleine Webanwendungen, meistens Demo-BeispieleEin Modell im Browser testen, bevor Sie 15 GB herunterladen

#Eine Modellseite lesen

Jedes Modell ist unter einer Adresse der Form huggingface.co/organisation/nom-du-modele zu finden, beispielsweise huggingface.co/Qwen/Qwen3-8B. Vier verschiedene Elemente dieser Seite verdienen vor jedem Download Ihre Aufmerksamkeit.

Der Name der Organisation
Qwen, google, meta-llama, mistralai, openai, deepseek-ai sind die verifizierten Organisationen der Labore selbst. Jeder andere Name bezeichnet einen Drittanbieter: manchmal hervorragend, aber niemals das Original des Labors.
Die Modellbeschreibung (Model card)
Die README-Datei: was das Modell ist, wie es trainiert wurde, seine vorgesehenen Einsatzbereiche, seine Bewertungsergebnisse, sein Prompt-Format und seine Grenzen. Die Qualität reicht von sehr ausführlich bis völlig leer.
Die Lizenz
Oben auf der Modellseite neben dem Modellnamen gut sichtbar angezeigt. Siehe den entsprechenden Abschnitt weiter unten dazu, was die einzelnen gängigen Lizenzen tatsächlich erlauben.
Die Registerkarte Files and versions
Die vollständige Liste der herunterladbaren Dateien. Ein kurzer Blick genügt, um sofort zu erkennen, in welcher Art von Repository Sie sich befinden.

#Welches Repository wählen: Originalgewichte oder GGUF

Was Sie in Files sehenWas es istFür welche ToolsGröße für ein 8B-Modell
model-00001-of-00004.safetensors…Originalgewichte in BF16, auf mehrere Dateien aufgeteilttransformers, vLLM, Fine-Tuning-Tools≈ 16 GB
…-Q4_K_M.gguf, …-Q8_0.ggufQuantisierte Konvertierungen, eine einzige Datei pro QuantisierungsstufeOllama, LM Studio, llama.cpp, KoboldCpp, Jan≈ 5 GB in Q4
Repositories …-AWQ, …-GPTQ, …-FP8Quantisierung für GPU-ServervLLM und gleichwertige Engines≈ 5 bis 9 GB
Repositories …-MLX-4bitFormat für Apple SiliconMLX, LM Studio auf dem Mac≈ 5 GB

Die Labore veröffentlichen vor allem den ersten Typ: die ursprünglichen Modellgewichte, wie sie aus dem Training hervorgehen. Die GGUF-Dateien, die Desktop-Anwendungen benötigen, werden separat von Personen oder Gruppen erstellt, die diese Modelle konvertieren: Manche Labore veröffentlichen ihre eigenen direkt, und Mitwirkende aus der Community wie bartowski, unsloth oder die Organisation ggml-org decken fast den gesamten Rest ab, meist schon wenige Stunden nach einer mit Spannung erwarteten Veröffentlichung. Um diese Dateien ohne Suchen auf gut Glück zu finden, öffnen Sie die Seite des ursprünglichen Modells und folgen Sie dem Link Quantizations im Modellbaum rechts auf der Seite. Oder suchen Sie in der Suchleiste des Hubs einfach nach dem Modellnamen gefolgt vom Wort GGUF; dort erscheinen in der Regel die am häufigsten heruntergeladenen Konvertierungen ganz oben in der Ergebnisliste.

#Die richtige Datei für Ihre Karte auswählen

Ein GGUF-Repository bietet oft gut zehn Dateien für dasselbe Modell, eine pro verfügbarer Quantisierungsstufe, von der stärksten Komprimierung bis zur höchsten Wiedergabetreue. Die Dateigröße entspricht ungefähr dem VRAM-Bedarf der Gewichte, sobald das Modell in den Speicher geladen ist. Halten Sie stets 1 bis 3 GB VRAM für den Gesprächskontext und als Betriebsreserve für das System frei.

Berechnet anhand des QuelLLM-Katalogs · 20/09/2026 · Größen auf das nächste volle GB aufgerundet
ModellQ4_K_MQ5_K_MQ8_0BF16Grafikkarte mit ausreichend Spielraum bei Q4
Qwen 3 8B5 GB6 GB9 GB16 GB8 GB
Gemma 4 12B7 GB9 GB13 GB24 GB12 GB
Qwen 3 14B9 GB11 GB16 GB28 GB12 GB
gpt-oss 20B13 GB16 GB23 GB42 GB16 GB
Mistral Small 3.2 24B14 GB17 GB26 GB48 GB16 GB
Qwen 3.8 27B16 GB19 GB29 GB54 GB24 GB
Llama 3.3 70B40 GB48 GB75 GB140 GB2 × 24 GB

#Drei Möglichkeiten zum Herunterladen

Die einfachste Lösung besteht darin, Ihr Tool dies erledigen zu lassen. Die Suche von LM Studio fragt direkt Hugging Face ab und zeigt an, welche Dateien auf Ihrem Rechner Platz finden. Sowohl Ollama als auch llama.cpp können ein GGUF-Repository anhand seines Namens herunterladen.

Über Ollama oder llama.cpp
# Ollama : lancer n'importe quel dépôt GGUF du Hub
ollama run hf.co/bartowski/Qwen_Qwen3-8B-GGUF:Q4_K_M

# llama.cpp : télécharger et servir
llama-server -hf bartowski/Qwen_Qwen3-8B-GGUF:Q4_K_M
Mit dem Befehlszeilenwerkzeug
pip install -U huggingface_hub
hf download bartowski/Qwen_Qwen3-8B-GGUF --include "*Q4_K_M.gguf" --local-dir ./models

Der Filter --include ist wichtig: Ohne ihn laden Sie alle Quantisierungen aus dem Repository herunter, oft mehr als 100 GB. Die dritte Möglichkeit ist der Browser: die Registerkarte Files and versions und der Download-Pfeil neben der Datei. Praktisch für eine einzelne GGUF-Datei, ungeeignet für die auf mehrere Dateien aufgeteilten Originalgewichte.

i
Erwähnt ein altes Tutorial huggingface-cli?
Ignorieren Sie es: Der Befehl huggingface-cli download ist veraltet und wurde mit Version 1.0 der Bibliothek huggingface_hub vollständig entfernt. Er wurde durch den kürzeren Befehl hf ersetzt, den Hugging Face selbst als „eine schnellere und benutzerfreundlichere CLI“ vorstellt. Die Umstellung ist einfach: Verwenden Sie überall dort, wo im alten Tutorial huggingface-cli download steht, hf download mit denselben Optionen.
i
Modelle mit bedingtem Zugriff
Einige Labore, darunter Meta für die Llama-Familie, verlangen, dass Sie vor dem Download ihre Bedingungen akzeptieren. Erstellen Sie ein kostenloses Konto, klicken Sie auf die Zugriffsschaltfläche auf der Modellseite und authentifizieren Sie anschließend das Befehlszeilentool einmal mit hf auth login und einem Token, das Sie in den Kontoeinstellungen erstellt haben. GGUF-Konvertierungen aus der Community sind in der Regel nicht zugriffsbeschränkt, aber die ursprüngliche Lizenz gilt dennoch für Sie.

#Lizenzen: offen bedeutet nicht ohne Bedingungen

Im QuelLLM-Katalog erfasste Lizenzen · 20/09/2026
LizenzKatalogbeispieleKommerzieller Einsatz
Apache 2.0Qwen-3-Familie, Gemma 4 12B, gpt-oss, Mistral Small 3.2Ja, mit Hinweis
MITDeepSeek-R1-Destillationen, GLM 4.7 FlashJa
Llama Community LicenseLlama 3.3 70BJa, unter Bedingungen: Namenskonventionen, Nutzungsrichtlinie, Schwellenwert für die Nutzerzahl
Nicht kommerziell, ForschungVerschiedene wissenschaftliche PublikationenNein

Im Zweifelsfall ist die auf der Modellseite angezeigte Kennzeichnung maßgeblich. Ein Modell, das von einem anderen abgeleitet, durch Fine-Tuning angepasst oder durch Zusammenführen erzeugt wurde, übernimmt in der Regel die Verpflichtungen seines Basismodells, selbst wenn die README-Datei des abgeleiteten Modells dies nicht ausdrücklich erwähnt. Für einen Einsatz im Unternehmen oder in einem kommerziellen Produkt verhindern diese zwei Minuten sorgfältiger Lizenzlektüre, dass Sie eine ganze Integration auf einem Modell aufbauen, dessen kommerzielle Nutzung tatsächlich eingeschränkt ist – ein häufiger Fehler, dessen nachträgliche Korrektur teuer ist.

#Ist das sicher?

Bevorzugen Sie .safetensors und .gguf
Das sind reine Datenformate. Die älteren PyTorch-Dateien .bin und .pt basieren auf dem pickle-Mechanismus von Python, der beim Laden Code ausführen kann. Der Hub kennzeichnet diese Dateien mit einer Warnung.
Seien Sie vorsichtig mit „trust remote code“
Einige Repositories, insbesondere für neuere Architekturen, die noch nicht in die Bibliothek transformers integriert sind, enthalten eigenen Python-Code. Bevor der Ladevorgang fortgesetzt wird, fordert der Loader Ihre ausdrückliche Erlaubnis an, diesen Code auszuführen. Erteilen Sie diese Erlaubnis nur für Organisationen, die Sie kennen und denen Sie vertrauen: Dieser Code wird mit denselben Rechten wie der Rest Ihres Python-Programms ausgeführt, ohne besondere Einschränkungen.
Schauen Sie, wer veröffentlicht
Die Gesamtzahl der Downloads, die Liste weiterer Repositorys derselben Organisation und ein Link von der offiziellen Website des Labors zu diesem Repository sind gute Anhaltspunkte für Vertrauenswürdigkeit. Konten, die bekannte Organisationen imitieren und dafür einen ähnlichen Namen mit einem Schreibfehler oder einem zusätzlichen Unterstrich verwenden, gibt es auf dem Hub ebenso wie anderswo im Web: Ein Blick auf die Downloadzahlen und das Alter des Kontos genügt oft, um sie zu erkennen.
Das Modell bleibt bei Ihnen
Nach dem Download stellt ein mit llama.cpp oder Ollama ausgeführtes GGUF keinerlei Netzwerkverbindungen mehr zu Hugging Face oder anderen Stellen her – anders als ein Modell, das über eine in der Cloud gehostete API genutzt wird. Ihre Prompts und Daten verlassen niemals Ihren Rechner: ein zentrales Datenschutzargument für alle, die sich für lokale KI statt für einen Onlinedienst entscheiden.

#FAQ

Wozu dient Hugging Face?+
Zum Veröffentlichen und Herunterladen offener KI-Modelle, von Datensätzen und kleinen Web-Demos. Für lokale KI ist dies die wichtigste Quelle für Modelldateien, insbesondere für quantisierte GGUF-Versionen, die Ollama, LM Studio und llama.cpp direkt laden. Diese werden oft von Community-Mitwirkenden wenige Stunden nach der offiziellen Veröffentlichung eines Modells durch dessen Ursprungslabor erstellt.
Ist Hugging Face kostenlos?+
Öffentliche Modelle anzusehen und herunterzuladen ist vollständig kostenlos und erfordert kein Konto. Eine Ausnahme sind Modelle mit Zugangsbeschränkungen, für die ein Konto erforderlich ist, das aber ebenfalls kostenlos bleibt. Das Unternehmen berechnet tatsächlich Gebühren für die auf seinen Servern gehostete Inferenz, zusätzliche Rechenleistung für Spaces, die Speicherung privater Repositories und seine Angebote für Unternehmen.
Ist Hugging Face ein französisches Unternehmen?+
Sie wurde 2016 von drei französischen Unternehmern gegründet: Clément Delangue, Julien Chaumond und Thomas Wolf. Sie unterhält weiterhin ein großes Team in Paris, ihr Unternehmenssitz befindet sich jedoch in New York in den USA. Sie ist eine der wenigen wirklich bedeutenden Plattformen der weltweiten KI-Branche mit derart ausgeprägten französischen Wurzeln.
Ist ein Konto erforderlich, um ein Modell herunterzuladen?+
In den allermeisten Fällen nicht: Für das Ansehen und Herunterladen öffentlicher Modelle ist kein Konto erforderlich. Ein kostenloses Konto und ein Zugriffstoken werden nur für Modelle benötigt, deren Entwicklungslabor die vorherige Zustimmung zu seinen Nutzungsbedingungen verlangt, etwa die Llama-Familie von Meta oder bestimmte Modellveröffentlichungen von Google.
Welche Datei sollte man für Ollama oder LM Studio herunterladen?+
Eine einzelne .gguf-Datei aus einem GGUF-Repository, für den Einstieg in der Regel die Variante Q4_K_M. Ihre Größe sollte 1 bis 3 GB unter der Speicherkapazität Ihrer Grafikkarte liegen. Die auf mehrere Teile aufgeteilten .safetensors-Dateien aus dem ursprünglichen Repository des Labors sind für Python-Frameworks wie transformers und Server-Engines wie vLLM bestimmt, nicht für Desktop-Anwendungen.
Muss man noch huggingface-cli verwenden, um ein Modell herunterzuladen?+
Nein: Dieser Befehl ist veraltet und wurde in huggingface_hub Version 1.0 entfernt. Der aktuelle Befehl, den Hugging Face als schneller und einfacher vorstellt, heißt hf: hf download gefolgt vom Repository-Namen funktioniert genau dort, wo ein älteres Tutorial huggingface-cli download verwendete, mit denselben Filteroptionen.

Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.