Einsteiger 9 Min.Edge

SmolLM3: Was taugt dieses kleine Modell von Hugging Face ?

Direkte Antwort

SmolLM3 ist ein mehrsprachiges Modell von Hugging Face mit 3 Milliarden Parametern, das unter anderem Französisch unterstützt. Es wurde mit einer Kontextlänge von 64.000 Tokens trainiert, die sich auf 128.000 erweitern lässt, und bietet einen Denkmodus, der sich über /think im Systemprompt aktivieren lässt. Wichtig vor der Installation: Auf Ollama gibt es keinen offiziellen Modelle­intrag unter library/smollm3, sondern nur Community-Tags oder die offizielle, auf Hugging Face gehostete GGUF-Datei, die über ihre vollständige Adresse abgerufen werden muss.

SmolLM3 ist das von Hugging Face veröffentlichte kleine Sprachmodell, das für den Betrieb auf weniger leistungsfähiger Hardware ausgelegt ist und dabei einen langen Kontext sowie einen optionalen Reasoning-Modus bietet. Dieser Leitfaden prüft, was das Modell tatsächlich bietet, zeigt, wie Sie es installieren und dabei die richtige Quelle wählen, und ordnet ein, was Sie bei 3 Milliarden Parametern vernünftigerweise erwarten können.

Von Mohamed Meguedmi·Aktualisierung 2026-09-28·Unter Windows, macOS und Linux getestet

#SmolLM3 in einem Satz

SmolLM3 ist ein von Hugging Face veröffentlichtes Sprachmodell mit 3 Milliarden Parametern. Es liegt zwischen den 1B-Modellen, die für den allgemeinen Einsatz zu eingeschränkt sind, und den 7–8B-Modellen mit höherem Speicherbedarf. Der Vorteil eines Modells dieser Größe besteht nicht darin, mit einem Modell mit 30B Parametern oder mehr zu konkurrieren, sondern darin, auf einem einfachen Rechner (Laptop ohne dedizierte GPU, Mini-PC) in den Speicher zu passen und dennoch für Zusammenfassungen, kurze Texte oder einfache Faktenfragen nutzbar zu bleiben.

#Was das Modell tatsächlich bietet

Das Kit Lokale KI

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Hugging Face gibt an, dass SmolLM3 mit einer dreistufigen Strategie auf 11,2 Billionen Tokens trainiert wird. Der Trainingskontext wird schrittweise erweitert, zunächst von 4.000 auf 32.000 Tokens und dann von 32.000 auf 64.000 Tokens; darüber hinaus kann das Modell dank einer technischen Extrapolation namens YARN 128.000 Tokens erreichen. Das ist das Doppelte der tatsächlich trainierten Kontextlänge und sollte als maximale Kapazität betrachtet werden, nicht als Garantie für gleichbleibende Qualität über diesen gesamten Kontext.

SmolLM3: Was die offizielle Modellkarte bestätigt
EigenschaftWert
Parameter3 Milliarden
Kontextlänge beim Training64.000 Tokens
Erweitertes Kontextfenster (YARN)128 000 Tokens
Trainings-Token11,2 T
Nativ unterstützte Sprachen6 (darunter Französisch)

#Warum ein 3B-Modell einen langen Kontext verarbeiten kann, ohne dass der Speicherbedarf explodiert

Hugging Face erläutert die Architekturentscheidungen, die diesen langen Kontext auch auf weniger leistungsfähiger Hardware praktikabel machen. SmolLM3 ersetzt die klassische Multi-Head-Attention durch Grouped-Query-Attention mit nur 4 Gruppen. Dadurch wird die Größe des KV-Caches, der pro generiertem Token gespeichert werden muss, direkt reduziert – der Hauptfaktor, der den RAM- oder VRAM-Verbrauch bei längerem Kontext in die Höhe treibt. Das Modell verwendet außerdem eine Technik namens NoPE (No Positional Encoding): RoPE, die übliche Positionskodierung, wird aus jeder vierten Schicht entfernt. Dieser dokumentierte Kompromiss soll die Leistung bei langem Kontext verbessern, ohne die Leistung bei kurzem Kontext zu beeinträchtigen.

Ein weiteres Trainingsdetail mit konkreten Auswirkungen auf die Qualität: Die Attention verwendet eine dokumentinterne Maskierung. Das bedeutet, dass Tokens aus zwei verschiedenen Dokumenten, die in derselben Trainingssequenz aneinandergehängt werden, sich nicht gegenseitig beeinflussen. Für Endnutzer verringert dies das Risiko, dass ein kompaktes Modell Informationen ohne Zusammenhang „vermischt“, wenn mehrere Quellen in denselben Kontext eingefügt werden. Dieser Fehler fällt bei kleinen Modellen stärker auf als bei großen.

→
Empfohlene Sampling-Einstellungen
Hugging Face empfiehlt temperature=0.6 und top_p=0.95 für Antworten im Standardmodus. Diese Werte gelten nicht universell: Sie beeinflussen das Gleichgewicht zwischen Kreativität und Kohärenz und dienen als Ausgangspunkt, bevor Sie sie an Ihren Anwendungsfall anpassen (zum Beispiel die Temperatur senken, um stärker faktenorientierte Antworten zu erhalten).

#Französisch als nativ unterstützte Sprache

Im Gegensatz zu vielen kleinen Modellen, die zunächst für Englisch entwickelt und anschließend angepasst wurden, nennt SmolLM3 Französisch als eine seiner sechs nativ unterstützten Sprachen, neben Englisch, Spanisch, Deutsch, Italienisch und Portugiesisch. Hugging Face erläutert außerdem, dass das Modell auch mit Daten auf Arabisch, Chinesisch und Russisch trainiert wurde, allerdings in geringerer Menge als bei den sechs Hauptsprachen. In diesen zusätzlichen Sprachen ist es daher mit Vorsicht einzusetzen: Die offizielle Modellkarte behauptet keine gleichwertige Qualität.

i
Überraschungsgradient
Ein kleines mehrsprachiges Modell ist nicht automatisch gut auf Französisch: Entscheidend ist die tatsächliche Verteilung der Trainingsdaten auf die einzelnen Sprachen, nicht die Anzahl der aufgeführten Sprachen. Hier gehört Französisch zum Kern des Trainings und ist kein bloßer Randzusatz.

#Installieren: Auf den Tag achten

Die erste Falle, die Sie vermeiden sollten: Zum Zeitpunkt der Erstellung dieses Textes gibt es im öffentlichen Ollama-Katalog keinen offiziellen Eintrag „library/smollm3“. Die unter diesem Namen auf ollama.com auffindbaren Tags sind von der Community bereitgestellte Varianten in persönlichen Namensräumen, ohne Garantie, dass sie dem ursprünglichen Repository entsprechen. Der zuverlässige Weg führt über die offizielle GGUF-Datei, die von der Organisation ggml-org auf Hugging Face veröffentlicht wurde und die Ollama und llama.cpp direkt über ihre vollständige Adresse laden können.

  1. 01
    Quelle prüfen
    Das offizielle Repository ggml-org/SmolLM3-3B-GGUF auf Hugging Face statt eines ungeprüften Community-Tags verwenden, um sicherzustellen, dass Modell und Tokenizer korrekt sind.
  2. 02
    Mit Ollama starten
    ollama run hf.co/ggml-org/SmolLM3-3B-GGUF:Q4_K_M ausführen; dieser Befehl lädt die Q4_K_M-Quantisierung direkt von Hugging Face herunter und startet sie.
  3. 03
    Oder mit llama.cpp starten
    llama-server -hf ggml-org/SmolLM3-3B-GGUF:Q4_K_M für einen lokalen Server oder llama-cli für eine Kommandozeilen-Sitzung verwenden.
  4. 04
    Die Quantisierung auswählen
    Q4_K_M (1,92 GB) für die meisten Rechner, Q8_0 (3,28 GB), wenn Sie genügend Speicher haben und den Qualitätsverlust begrenzen möchten, F16 (6,16 GB) nur als Vergleichsreferenz.
SmolLM3 über Ollama starten (offizielles Hugging-Face-Repository)
ollama run hf.co/ggml-org/SmolLM3-3B-GGUF:Q4_K_M

Ein Community-Tag, alibayram/smollm3, ist auch direkt im öffentlichen Ollama-Katalog verfügbar (ollama pull alibayram/smollm3) und funktioniert ohne die vollständige Hugging-Face-Adresse. Er wird allerdings weiterhin von einem einzelnen Mitwirkenden gepflegt, weder von Hugging Face noch vom Ollama-Team: Bei Zweifeln an einer Version oder bei unerwartetem Verhalten bleibt die offizielle GGUF-Datei von ggml-org die Referenz für einen Vergleich, bevor Sie auf einen Fehler im Modell selbst schließen.

#Den Denkmodus aktivieren

SmolLM3 arbeitet in zwei Modi: einem direkten Modus und einem Reasoning-Modus, der vor der Antwort eine Folge von Gedankenschritten erzeugt. Der Modus wird aktiviert, indem Sie die Kennzeichnung /think in den an das Modell gesendeten Systemprompt einfügen; mit /no_think deaktivieren Sie ihn. Diese Einstellung erfolgt in der Systemnachricht, nicht über eine Startoption: Jede Oberfläche, in der sich der Systemprompt anpassen lässt, kann diesen Modus daher aktivieren.

→
Mit llama.cpp
Um den erweiterten Reasoning-Modus mit llama.cpp zu nutzen, empfiehlt die offizielle Dokumentation, beim Start die Option --jinja hinzuzufügen. Sie aktiviert die korrekte Verarbeitung der für diesen Modus erforderlichen Chat-Vorlage.

Der Reasoning-Modus verursacht zusätzlichen Aufwand: Jede Antwort beginnt vor dem endgültigen Text mit einer mehr oder weniger langen internen Denkphase. Dadurch steigen die Anzahl der generierten Tokens und damit die Antwortzeit. Für eine einfache Faktenfrage reicht der direkte Modus (/no_think) völlig aus und ist deutlich schneller.

#Wie man SmolLM3 gegenüber anderen Größen einordnet

Ein Modell mit 3B Parametern befindet sich im mittleren Bereich des Marktes für kleine Modelle: es ist leistungsfähiger als ein 1B-Modell, oft auf einfache Aufgaben und einen eher steifen Stil beschränkt, aber weniger vielseitig als ein 7-8B-Modell, das weiterhin die Referenz für allgemeinen Einsatz auf einer Maschine mit 8 GB RAM oder mehr darstellt. Die Frage, die sich stellen sollte, ist nicht „Ist SmolLM3 absolut gut?“, sondern „Stimmt meine Maschine und mein Nutzungsszenario damit, auf 3B herabzugehen, anstatt auf ein 7-8B-Modell zu bleiben?“

Die angegebene Kontextlänge (auf 64.000 Token trainiert, bis zu 128.000 durch Extrapolation) ist ein Unterscheidungsmerkmal gegenüber kleinen Konkurrenzmodellen, die oft auf 8.000 oder 32.000 Token begrenzt sind. Konkret lässt sich damit ein längeres Dokument auf einmal eingeben, beispielsweise für eine Zusammenfassung, ohne es vorher aufzuteilen. Dieser Kontextvorteil gleicht jedoch mangelnde Fähigkeiten zum logischen Schlussfolgern nicht aus: Bei einer Frage, die mehrere aufeinander aufbauende logische Schritte erfordert, bleibt ein größeres Modell im Allgemeinen zuverlässiger, ob mit langem Kontext oder ohne.

i
Informationsgewinn
Die von Hugging Face dokumentierte stufenweise Kontexterweiterung (4k, dann 32k, dann 64k) zeigt, dass das Training mit langem Kontext in aufeinanderfolgenden Schritten mit eigens dafür vorgesehenen Tokenmengen erfolgt (100 Milliarden Tokens allein für die Kontexterweiterung), statt in einem einzigen Durchlauf. Diese Information hilft zu verstehen, warum die Qualität je nach tatsächlicher Länge des verarbeiteten Textes variieren kann, selbst unterhalb der angegebenen Obergrenze.

Was die Ergebnisse betrifft, gibt Hugging Face an, dass SmolLM3 Llama-3.2-3B und Qwen2.5-3B in einer Reihe von 12 öffentlichen Benchmarks zu Wissen, logischem Schlussfolgern, Mathematik und Code übertrifft und dabei mit größeren 4B-Modellen konkurrenzfähig bleibt. Diese Angabe stammt vom Herausgeber des Modells und ist keine unabhängige Messung: Sie ordnet SmolLM3 in seiner Größenklasse unter den besten Modellen ein, ersetzt aber keinen Test mit Ihren eigenen Prompts, wenn Ihre Nutzung über den Rahmen dieser allgemeinen Benchmarks hinausgeht.

Verteilung der Trainingsdaten entsprechend dem Fortschritt (Quelle: Hugging Face)
SchrittGesamttokensWebCodeMathematik
Phase 10 à 8 T85 %12 %3 %
Stufe 28 à 10 T75 %15 %10 %
Stufe 310 à 11,1 T63 %24 %13 %

Der zunehmende Anteil von Code und Mathematik gegen Ende des Trainings (Code von 12 % auf 24 %, Mathematik von 3 % auf 13 %) erklärt teilweise, warum ein Modell dieser Größe einfache Programmier- und Rechenaufgaben bewältigt, während ein kleines Modell, das ausschließlich mit allgemeinen Webtexten trainiert wurde, daran häufiger scheitert.

#Wofür 3B wirklich nützlich ist

Zusammenfassung kurzer Texte
Effizient bei Dokumenten mit einigen Seiten, mit einem komfortablen Kontext bis zu 64.000 Trainings-Token.
Erstellung kurzer Entwürfe
E-Mails, Nachrichten, Umformulierungen: ein typischer Einsatz für ein kompaktes Modell, ohne Anspruch auf fortgeschrittene kreative Leistungen.
Einfache Fragen zu Fakten
Korrekte Antworten zu allgemein bekannten Fakten, mit einem höheren Fehlerrisiko bei anspruchsvollen Detailfragen als bei einem größeren Modell.
Integration in eingebettete Systeme
Die geringe Modellgröße und die speichersparenden Quantisierungen (1,92 GB in Q4_K_M) machen es eher zu einem Kandidaten für Rechner mit begrenztem Speicher als für Aufgaben, die komplexes Schlussfolgern erfordern.

#Das kann ein 3B nicht leisten

Keine offizielle Quelle veröffentlicht Leistungsmessungen für SmolLM3 auf Hardware für Endverbraucher wie einem Raspberry Pi: Solche Versprechen müssen Sie selbst überprüfen, bevor Sie sie als Grundlage für eine Bereitstellung verwenden. Ebenso ist der mit YARN auf 128.000 Tokens erweiterte Kontext eine technische Fähigkeit, aber kein Beleg dafür, dass die Antwortqualität bei einem so langen Dokument konstant bleibt: Ein Test mit Ihrem eigenen Anwendungsfall ist weiterhin notwendig, bevor Sie sich bei einem kritischen Einsatz darauf verlassen.

!
Einwand: „Warum nicht gleich ein 7B-Modell?“
Wenn Ihre Maschine über mindestens 8 GB RAM verfügt, liefert ein 7–8B-Modell in Q4 in der Regel insgesamt bessere Ergebnisse. SmolLM3 ist sinnvoll, wenn der Arbeitsspeicher oder der Speicherplatz tatsächlich knapp ist oder wenn ein langer Kontext bei einem 3B-Modell für Ihren Einsatzzweck entscheidend ist.
Häufig gestellte Fragen
Ist SmolLM3 direkt auf Ollama verfügbar?+
Zum Zeitpunkt der Erstellung nicht über einen offiziellen Eintrag library/smollm3. Der zuverlässige Befehl bleibt ollama run hf.co/ggml-org/SmolLM3-3B-GGUF:Q4_K_M, der das offizielle GGUF von Hugging Face mit der Quantisierung Ihrer Wahl herunterlädt. Ein Community-Tag, alibayram/smollm3, existiert ebenfalls und funktioniert, wird aber nur von einem einzelnen Mitwirkenden gepflegt, nicht von Hugging Face oder dem Ollama-Team.
Spricht SmolLM3 gut Französisch?+
Französisch gehört laut der Hugging-Face-Modellkarte zu den 6 nativ unterstützten Sprachen, neben Englisch, Spanisch, Deutsch, Italienisch und Portugiesisch. Dafür gibt es eine eigene Grundlage an Trainingsdaten, statt die Sprache nur am Rande zu berücksichtigen. Das ist eine der Stärken des Modells gegenüber kleinen Modellen, die in erster Linie auf Englisch ausgerichtet sind.
Wie aktiviert man den Reasoning-Modus von SmolLM3?+
Indem Sie die Kennzeichnung /think in den an das Modell gesendeten Systemprompt einfügen (oder /no_think, um den Denkmodus zu deaktivieren und im schnelleren direkten Modus zu bleiben). Fügen Sie bei llama.cpp beim Start die Option --jinja hinzu, damit das für diesen Modus erforderliche Chat-Template korrekt angewendet wird. Andernfalls kann es passieren, dass die Denkphase nie sauber endet.
Welche Quantisierung sollte ich für SmolLM3 wählen?+
Q4_K_M (1,92 GB) eignet sich für die meisten Rechner und bleibt die empfohlene Standardeinstellung für ein gutes Verhältnis zwischen Qualität und Speicherbedarf. Q8_0 (3,28 GB) reduziert den Qualitätsverlust, wenn Sie genügend Speicher zur Verfügung haben. F16 (6,16 GB) dient vor allem als Vergleichsreferenz bei Ihren Tests und ist beim alltäglichen Einsatz eines 3B-Modells selten nützlich.
Welche Sampling-Einstellungen sind mit SmolLM3 geeignet?+
Hugging Face empfiehlt temperature=0.6 und top_p=0.95 als Ausgangswerte im Standardmodus. Diese Werte sorgen für ein Gleichgewicht zwischen Konsistenz und Vielfalt der Antworten. Die Einstellungen sind nicht universell geeignet: Niedrigere Werte helfen dabei, für technische Anwendungen sachlichere und besser reproduzierbare Antworten zu erhalten; eine leichte Erhöhung begünstigt abwechslungsreichere Umformulierungen beim kreativen Schreiben.
Ist SmolLM3 besser als Qwen2.5-3B oder Llama-3.2-3B?+
Hugging Face gibt an, dass SmolLM3 diese beiden Modelle in 12 öffentlichen Benchmarks zu Wissen, Schlussfolgern, Mathematik und Code übertrifft und dabei mit 4B-Modellen konkurrenzfähig bleibt. Dies ist ein vom Anbieter veröffentlichtes Ergebnis, das Sie mit Ihren eigenen Prompts überprüfen sollten, wenn Ihr tatsächlicher Einsatz von diesen allgemeinen Benchmarks abweicht.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.