Hugging Face: Was ist das und wie verwendet man es ?
Hugging Face ist die Plattform, auf der fast alle offenen KI-Modelle veröffentlicht werden: Qwen, Llama, Gemma, Mistral, gpt-oss, DeepSeek. Sie wird oft als das GitHub des maschinellen Lernens beschrieben: das zentrale Archiv, aus dem die Dateien stammen, einschließlich derjenigen, die Ollama und LM Studio für Sie herunterladen. Am 18. August 2026 überschritt der Hub die Marke von drei Millionen öffentlichen Modellen, ohne jegliche redaktionelle Auswahl.
Hugging Face ist die Plattform, auf der fast alle offenen KI-Modelle veröffentlicht werden: Qwen, Llama, Gemma, Mistral, gpt-oss, DeepSeek. Sie wird oft als das GitHub des maschinellen Lernens beschrieben. Wer eine KI auf dem eigenen Rechner betreibt, bezieht von dort sämtliche Dateien, einschließlich derer, die Ollama und LM Studio für Sie herunterladen. Der Hub hat am 18. August 2026 offiziell die Marke von drei Millionen öffentlichen Modellen überschritten, bei etwa 2.700 bis 3.000 neuen Modellen pro Tag und ohne jegliche Vorauswahl. Diese Seite zeigt Ihnen, wie Sie sich dort zurechtfinden: welches Repository Sie öffnen, welche Datei Sie für Ihre Grafikkarte auswählen und was Sie vor dem Klicken überprüfen sollten.
#Was ist Hugging Face?
Hugging Face ist ein Unternehmen, das 2016 von den drei französischen Unternehmern Clément Delangue, Julien Chaumond und Thomas Wolf gegründet wurde. Es ist in New York und Paris ansässig, wobei sein Hauptsitz weiterhin in den Vereinigten Staaten liegt. Angefangen hat es mit einer Chatbot-App für Jugendliche, einem inzwischen aufgegebenen Projekt. Daher stammt auch der Name, der dem lächelnden Emoji mit offenen Händen entlehnt ist. Anschließend wandte sich das Unternehmen Open-Source-Werkzeugen für maschinelles Lernen zu: Seine Bibliothek transformers ist praktisch zum Standard geworden, um Sprachmodelle in Python zu laden und auszuführen, und wird von den meisten Forschungslabors und Unternehmen der Branche genutzt. Schließlich entwickelte das Unternehmen den Hub, eine Hosting-Plattform auf Basis des Versionsverwaltungssystems Git, auf der jeder kostenlos Modelle, Datensätze und kleine Web-Demos veröffentlichen kann, ohne vorherige redaktionelle Prüfung.
Für lokale KI übernimmt der Hub die Rolle eines App-Stores, mit zwei Unterschieden: Fast alles ist kostenlos, und nichts wird für Sie ausgewählt. Anders als in einem klassischen App-Store testet, genehmigt oder ordnet niemand die Modelle vor ihrer Veröffentlichung ein: Jeder kann ein kostenloses Konto erstellen und innerhalb weniger Minuten ein Repository hochladen, ohne jegliche Prüfung oder Qualitätskontrolle. Dieses völlige Fehlen von Filtern ist zugleich die Stärke des Hubs – alles erscheint dort zuerst, oft noch vor der offiziellen Ankündigung eines Labors – und seine größte Falle für Einsteiger, die vor Hunderten von Suchergebnissen stehen können, ohne zu wissen, welches verlässlich ist. Sich zurechtzufinden, ein offizielles Repository von einer Kopie eines Drittanbieters und eine seriöse Konvertierung von einem aufgegebenen Versuch zu unterscheiden, ist die Fähigkeit, die man erwerben sollte, bevor man irgendetwas herunterlädt.
#Die drei Bereiche des Hubs
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
| Bereich | Inhalt | Nutzen für lokale KI |
|---|---|---|
| Models | Gewichtsdateien, Konfiguration, Dokumentation | Hier befindet sich die Datei, die Sie ausführen werden |
| Datasets | Trainings- und Bewertungsdaten | Nur bei Fine-Tuning oder Tests |
| Spaces | Kleine Webanwendungen, meistens Demo-Beispiele | Ein Modell im Browser testen, bevor Sie 15 GB herunterladen |
#Eine Modellseite lesen
Jedes Modell ist unter einer Adresse der Form huggingface.co/organisation/nom-du-modele zu finden, beispielsweise huggingface.co/Qwen/Qwen3-8B. Vier verschiedene Elemente dieser Seite verdienen vor jedem Download Ihre Aufmerksamkeit.
- Der Name der Organisation
- Qwen, google, meta-llama, mistralai, openai, deepseek-ai sind die verifizierten Organisationen der Labore selbst. Jeder andere Name bezeichnet einen Drittanbieter: manchmal hervorragend, aber niemals das Original des Labors.
- Die Modellbeschreibung (Model card)
- Die README-Datei: was das Modell ist, wie es trainiert wurde, seine vorgesehenen Einsatzbereiche, seine Bewertungsergebnisse, sein Prompt-Format und seine Grenzen. Die Qualität reicht von sehr ausführlich bis völlig leer.
- Die Lizenz
- Oben auf der Modellseite neben dem Modellnamen gut sichtbar angezeigt. Siehe den entsprechenden Abschnitt weiter unten dazu, was die einzelnen gängigen Lizenzen tatsächlich erlauben.
- Die Registerkarte Files and versions
- Die vollständige Liste der herunterladbaren Dateien. Ein kurzer Blick genügt, um sofort zu erkennen, in welcher Art von Repository Sie sich befinden.
#Welches Repository wählen: Originalgewichte oder GGUF
| Was Sie in Files sehen | Was es ist | Für welche Tools | Größe für ein 8B-Modell |
|---|---|---|---|
| model-00001-of-00004.safetensors… | Originalgewichte in BF16, auf mehrere Dateien aufgeteilt | transformers, vLLM, Fine-Tuning-Tools | ≈ 16 GB |
| …-Q4_K_M.gguf, …-Q8_0.gguf | Quantisierte Konvertierungen, eine einzige Datei pro Quantisierungsstufe | Ollama, LM Studio, llama.cpp, KoboldCpp, Jan | ≈ 5 GB in Q4 |
| Repositories …-AWQ, …-GPTQ, …-FP8 | Quantisierung für GPU-Server | vLLM und gleichwertige Engines | ≈ 5 bis 9 GB |
| Repositories …-MLX-4bit | Format für Apple Silicon | MLX, LM Studio auf dem Mac | ≈ 5 GB |
Die Labore veröffentlichen vor allem den ersten Typ: die ursprünglichen Modellgewichte, wie sie aus dem Training hervorgehen. Die GGUF-Dateien, die Desktop-Anwendungen benötigen, werden separat von Personen oder Gruppen erstellt, die diese Modelle konvertieren: Manche Labore veröffentlichen ihre eigenen direkt, und Mitwirkende aus der Community wie bartowski, unsloth oder die Organisation ggml-org decken fast den gesamten Rest ab, meist schon wenige Stunden nach einer mit Spannung erwarteten Veröffentlichung. Um diese Dateien ohne Suchen auf gut Glück zu finden, öffnen Sie die Seite des ursprünglichen Modells und folgen Sie dem Link Quantizations im Modellbaum rechts auf der Seite. Oder suchen Sie in der Suchleiste des Hubs einfach nach dem Modellnamen gefolgt vom Wort GGUF; dort erscheinen in der Regel die am häufigsten heruntergeladenen Konvertierungen ganz oben in der Ergebnisliste.
- GGUF und safetensors: Die Modelldateiformate verstehen
- vLLM: die Engine, die die ursprünglichen Gewichte verwendet
#Die richtige Datei für Ihre Karte auswählen
Ein GGUF-Repository bietet oft gut zehn Dateien für dasselbe Modell, eine pro verfügbarer Quantisierungsstufe, von der stärksten Komprimierung bis zur höchsten Wiedergabetreue. Die Dateigröße entspricht ungefähr dem VRAM-Bedarf der Gewichte, sobald das Modell in den Speicher geladen ist. Halten Sie stets 1 bis 3 GB VRAM für den Gesprächskontext und als Betriebsreserve für das System frei.
| Modell | Q4_K_M | Q5_K_M | Q8_0 | BF16 | Grafikkarte mit ausreichend Spielraum bei Q4 |
|---|---|---|---|---|---|
| Qwen 3 8B | 5 GB | 6 GB | 9 GB | 16 GB | 8 GB |
| Gemma 4 12B | 7 GB | 9 GB | 13 GB | 24 GB | 12 GB |
| Qwen 3 14B | 9 GB | 11 GB | 16 GB | 28 GB | 12 GB |
| gpt-oss 20B | 13 GB | 16 GB | 23 GB | 42 GB | 16 GB |
| Mistral Small 3.2 24B | 14 GB | 17 GB | 26 GB | 48 GB | 16 GB |
| Qwen 3.8 27B | 16 GB | 19 GB | 29 GB | 54 GB | 24 GB |
| Llama 3.3 70B | 40 GB | 48 GB | 75 GB | 140 GB | 2 × 24 GB |
- Q4, Q5, Q8 oder FP16: Quantisierung wählen
- VRAM: die eigene kennen und wissen, was damit möglich ist
- Der VRAM-Rechner
#Drei Möglichkeiten zum Herunterladen
Die einfachste Lösung besteht darin, Ihr Tool dies erledigen zu lassen. Die Suche von LM Studio fragt direkt Hugging Face ab und zeigt an, welche Dateien auf Ihrem Rechner Platz finden. Sowohl Ollama als auch llama.cpp können ein GGUF-Repository anhand seines Namens herunterladen.
Der Filter --include ist wichtig: Ohne ihn laden Sie alle Quantisierungen aus dem Repository herunter, oft mehr als 100 GB. Die dritte Möglichkeit ist der Browser: die Registerkarte Files and versions und der Download-Pfeil neben der Datei. Praktisch für eine einzelne GGUF-Datei, ungeeignet für die auf mehrere Dateien aufgeteilten Originalgewichte.
#Lizenzen: offen bedeutet nicht ohne Bedingungen
| Lizenz | Katalogbeispiele | Kommerzieller Einsatz |
|---|---|---|
| Apache 2.0 | Qwen-3-Familie, Gemma 4 12B, gpt-oss, Mistral Small 3.2 | Ja, mit Hinweis |
| MIT | DeepSeek-R1-Destillationen, GLM 4.7 Flash | Ja |
| Llama Community License | Llama 3.3 70B | Ja, unter Bedingungen: Namenskonventionen, Nutzungsrichtlinie, Schwellenwert für die Nutzerzahl |
| Nicht kommerziell, Forschung | Verschiedene wissenschaftliche Publikationen | Nein |
Im Zweifelsfall ist die auf der Modellseite angezeigte Kennzeichnung maßgeblich. Ein Modell, das von einem anderen abgeleitet, durch Fine-Tuning angepasst oder durch Zusammenführen erzeugt wurde, übernimmt in der Regel die Verpflichtungen seines Basismodells, selbst wenn die README-Datei des abgeleiteten Modells dies nicht ausdrücklich erwähnt. Für einen Einsatz im Unternehmen oder in einem kommerziellen Produkt verhindern diese zwei Minuten sorgfältiger Lizenzlektüre, dass Sie eine ganze Integration auf einem Modell aufbauen, dessen kommerzielle Nutzung tatsächlich eingeschränkt ist – ein häufiger Fehler, dessen nachträgliche Korrektur teuer ist.
#Ist das sicher?
- Bevorzugen Sie .safetensors und .gguf
- Das sind reine Datenformate. Die älteren PyTorch-Dateien .bin und .pt basieren auf dem pickle-Mechanismus von Python, der beim Laden Code ausführen kann. Der Hub kennzeichnet diese Dateien mit einer Warnung.
- Seien Sie vorsichtig mit „trust remote code“
- Einige Repositories, insbesondere für neuere Architekturen, die noch nicht in die Bibliothek transformers integriert sind, enthalten eigenen Python-Code. Bevor der Ladevorgang fortgesetzt wird, fordert der Loader Ihre ausdrückliche Erlaubnis an, diesen Code auszuführen. Erteilen Sie diese Erlaubnis nur für Organisationen, die Sie kennen und denen Sie vertrauen: Dieser Code wird mit denselben Rechten wie der Rest Ihres Python-Programms ausgeführt, ohne besondere Einschränkungen.
- Schauen Sie, wer veröffentlicht
- Die Gesamtzahl der Downloads, die Liste weiterer Repositorys derselben Organisation und ein Link von der offiziellen Website des Labors zu diesem Repository sind gute Anhaltspunkte für Vertrauenswürdigkeit. Konten, die bekannte Organisationen imitieren und dafür einen ähnlichen Namen mit einem Schreibfehler oder einem zusätzlichen Unterstrich verwenden, gibt es auf dem Hub ebenso wie anderswo im Web: Ein Blick auf die Downloadzahlen und das Alter des Kontos genügt oft, um sie zu erkennen.
- Das Modell bleibt bei Ihnen
- Nach dem Download stellt ein mit llama.cpp oder Ollama ausgeführtes GGUF keinerlei Netzwerkverbindungen mehr zu Hugging Face oder anderen Stellen her – anders als ein Modell, das über eine in der Cloud gehostete API genutzt wird. Ihre Prompts und Daten verlassen niemals Ihren Rechner: ein zentrales Datenschutzargument für alle, die sich für lokale KI statt für einen Onlinedienst entscheiden.
- Offizielle Dokumentation des Hugging Face Hub
- Der QuelLLM-Katalog: 249 Modelle nach Hardware sortiert
- Quelle: Wikipedia, Unternehmensgeschichte
- Quelle: offizielle Ankündigung der neuen CLI hf
#FAQ
Wozu dient Hugging Face?+
Ist Hugging Face kostenlos?+
Ist Hugging Face ein französisches Unternehmen?+
Ist ein Konto erforderlich, um ein Modell herunterzuladen?+
Welche Datei sollte man für Ollama oder LM Studio herunterladen?+
Muss man noch huggingface-cli verwenden, um ein Modell herunterzuladen?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.