Einsteiger 8 minKonzepte

LLM 7B, 30B, 70B: Was bedeuten diese Größen ?

Auf Hugging Face oder Ollama trägt jedes Modell eine Zahl: 1B, 7B, 32B, 70B. Diese Zahl – die Anzahl der Parameter in Milliarden – bestimmt, was das Modell leisten kann, wie viel VRAM es benötigt und wie schnell es ist. Doch ein aktuelles 7B-LLM kann ein 70B-Modell von vor zwei Jahren schlagen, und „größer“ bedeutet nicht „besser für Sie“. Dieser Leitfaden erklärt, was ein Parameter ist, was jede Größenstufe tatsächlich bringt und wie Sie zwischen Größe, Quantisierung und Hardware abwägen, ohne auf Marketing hereinzufallen.

Von Clara M.·Aktualisierung 2026-09-21·Unter Windows, macOS und Linux getestet

#Was ist konkret ein Parameter?

Ein Parameter ist eine Zahl. Nicht mehr: ein numerischer Wert, oft mit 16 Bit codiert, der während des Trainings gelernt wird. Ein „7B“-Modell enthält 7 Milliarden davon. Diese Zahlen sind die Gewichte der Verbindungen zwischen den künstlichen Neuronen des Netzwerks – sie codieren alles, was das Modell „weiß“: Grammatik, Fakten, Formulierungen und gedankliche Assoziationen.

Die treffendste Analogie ist die der Synapsen. Ein Parameter ist wie die Stärke einer Verbindung zwischen zwei Neuronen im Gehirn. Je mehr Verbindungen es gibt, desto mehr Nuancen und subtile Muster kann das Netzwerk speichern. Ein Modell mit 1 Milliarde Parametern hat etwa 1 Milliarde dieser Einstellungen; ein 70B-Modell hat siebzigmal so viele. Jeder Parameter ist für sich genommen winzig und simpel; erst ihre Anzahl und ihr Zusammenspiel erzeugen die Sprache.

i
Warum das „B“
Das B steht für das englische Wort „billion“, also eine Milliarde. 7B = 7 Milliarden Parameter. Diese Zahl sagt nichts über die Qualität der Trainingsdaten oder die Architektur aus – nur über die reine Größe des Netzwerks.

Konkret benötigen diese Parameter Speicherplatz. Bei 16 Bit (FP16) belegt jeder Parameter 2 Byte: Ein 7B-Modell benötigt daher bei voller Präzision etwa 14 GB. Diese Größe auf dem Datenträger und im Speicher entscheidet darüber, ob das Modell auf Ihren Rechner passt — darauf kommen wir bei der Quantisierung zurück, die diese Gewichte komprimiert.

#Die tatsächlichen Fähigkeiten – von 1B bis 70B

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Die Fähigkeiten wachsen nicht linear mit der Größe, sondern nehmen in Stufen zu. Wird eine bestimmte Schwelle bei der Parameterzahl überschritten, treten plötzlich neue Fähigkeiten auf – das nennt man emergente Fähigkeiten. Im Folgenden sehen Sie, was sich bei neueren Modellen in der Praxis beobachten lässt.

1B – 3B
Textvervollständigung, einfache Umformulierung, Klassifikation, Schlüsselwortextraktion. Nützlich auf Mobilgeräten oder Edge-Systemen, aber schwach beim logischen Schlussfolgern und mit häufigen Halluzinationen, sobald die Aufgaben komplexer werden.
7B – 8B
Die erste wirklich nützliche Größenklasse. Kohärente Gespräche, zuverlässige Zusammenfassungen, einfacher Code, ordentliches Befolgen von Anweisungen. Das ist der Einstieg in die ernsthafte Nutzung lokaler LLMs.
13B – 14B
Bessere Leistung bei langen Aufgaben, weniger sachliche Fehler, robusterer Code. Etwas differenzierter als ein 7B-Modell, ohne dass der VRAM-Bedarf explodiert.
30B – 34B
Zuverlässigeres Schlussfolgern über mehrere Schritte, nuancierte Antworten, gute Code- und Übersetzungsqualität. Der ideale Kompromiss zwischen Qualität und Kosten für anspruchsvollen lokalen Einsatz.
70B
Die Spitzenklasse für den allgemeinen Gebrauch. Bei vielen Aufgaben kommt die Fähigkeit zum logischen Schlussfolgern der von Cloud-Modellen nahe, mit detaillierten und nuancierten Antworten. Erfordert leistungsfähige Hardware oder Offloading.

Merken Sie sich: Jede Verdopplung der Größe bringt einen echten, aber abnehmenden Zugewinn. Der Sprung von 1B auf 7B ist spektakulär; der von 30B auf 70B ist real, aber deutlich subtiler und nur sinnvoll, wenn Ihre Aufgabe ihn erfordert.

#Was ein 7B-LLM kann, ein 1B-LLM aber nicht

Das ist der anschaulichste Vergleich, weil die Kluft enorm ist, obwohl der Größenunterschied auf den ersten Blick gering erscheint. Ein 1B-Modell wiederholt Muster; ein 7B-Modell beginnt, logisch zu denken. Der Wechsel vom einen zum anderen erschließt konkrete Fähigkeiten, die Sie bei der Nutzung sofort bemerken.

Eine Anweisung mit mehreren Teilen befolgen
Ein 1B-Modell vergisst oft die zweite Hälfte Ihrer Anfrage. Ein 7B-Modell kann eine Anweisung wie „Fasse diesen Text in 3 Punkten zusammen und übersetze sie dann ins Englische“ befolgen.
Schrittweises Schlussfolgern
Eine logische oder mathematische Aufgabe mit zwei oder drei Schritten bleibt außerhalb der Fähigkeiten eines 1B-Modells; ein 7B-Modell zerlegt sie in vielen Fällen korrekt in einzelne Schritte.
Kohärenz in langen Texten
Das 1B-Modell verliert nach einigen Absätzen den Faden. Das 7B-Modell bewahrt Kontext, Ton und Eigennamen über eine vollständige Antwort hinweg.
Funktionierender Code
Ein spezialisiertes 7B-Modell schreibt korrekte Funktionen und behebt einfache Fehler; ein 1B-Modell erzeugt vor allem Code, der lediglich wie Code „aussieht“.
Weniger Halluzinationen
Ohne sie vollständig zu beseitigen, erfindet das 7B-Modell deutlich weniger und kann häufiger sagen, dass es etwas nicht weiß.
→
Der Schwellenwert 7B
Wenn Ihr Rechner es erlaubt, beginnen Sie immer mit einem 7B/8B-Modell statt mit einem 3B-Modell. Der Zuverlässigkeitsgewinn ist im Verhältnis zum zusätzlichen VRAM-Bedarf (etwa 5 GB in Q4) überproportional groß.

#Größe und VRAM: Die Tabelle, die zählt

Die praktische Frage lautet nicht „Welches ist das beste Modell?“, sondern „Welches Modell passt auf meine Grafikkarte?“. Der benötigte VRAM hängt direkt von der Anzahl der Parameter ab. Hier sind die Richtwerte für die Quantisierung Q4_K_M, das standardmäßig empfohlene Format, das die Größe gegenüber FP16 auf etwa ein Viertel reduziert.

3B ≈ 2 GB
Läuft überall, selbst auf einer Einsteiger-Grafikkarte oder auf der CPU. Ideal für mobile Geräte und einfache Aufgaben.
7B ≈ 5 GB
Läuft problemlos auf einer RTX 3060 mit 12 GB oder einer RTX 4070 mit 12 GB. Das beste Verhältnis zwischen Leistungsfähigkeit und Zugänglichkeit.
14B ≈ 9 GB
Passt bei einer angemessenen Kontextlänge in 12 GB VRAM, mit 16 GB bleibt reichlich Spielraum.
32B ≈ 19 GB
Setzen Sie auf eine RTX 4090 mit 24 GB oder auf eine Karte mit 16 GB, bei der ein kleiner Teil des Modells in den RAM ausgelagert wird.
70B ≈ 40 GB
Mit einer einzelnen Consumer-Grafikkarte nicht machbar: zwei GPUs, Offloading in RAM/SSD oder ein Mac mit Apple Silicon und großzügigem gemeinsamem Arbeitsspeicher (M4 Pro 48 GB).
!
Den Kontext nicht vergessen
Diese Werte beziehen sich ausschließlich auf die Modellgewichte. Der Kontextbereich (der KV-Cache) verbraucht zusätzlich VRAM, je größer dieser ist. Planen Sie eine Margen von 1 bis einigen GB über der Modellgröße ein.

#Größe versus Quantisierung: die entscheidende Abwägung

Bei begrenztem VRAM haben Sie zwei Möglichkeiten: ein kleineres Modell wählen oder ein größeres, aber stärker komprimiertes Modell verwenden. Die Quantisierung reduziert die Präzision der Parameter – von 16 Bit auf 4 oder 8 Bit –, damit das Modell weniger Speicher benötigt, allerdings auf Kosten eines leichten Qualitätsverlusts.

Die in der Praxis bewährte Faustregel: Ein größeres, stärker quantisiertes Modell schlägt bei gleichem VRAM fast immer ein kleineres Modell in voller Präzision. Ein 13B in Q4 passt in genauso viel Speicher wie ein 7B in Q8 und erweist sich in der Regel als leistungsfähiger. Die Anzahl der Parameter wiegt schwerer als die letzten Bits an Präzision.

Q4_K_M
Der empfohlene Standard. Minimale Qualitätsverlust, Speicher wird durch ~4 geteilt. Standardwahl für fast alle Anwendungen.
Q5_K_M
Etwas höhere Qualität bei etwas mehr VRAM-Bedarf. Ein guter Kompromiss, wenn der Speicher ausreicht.
Q8_0
Kaum von FP16 zu unterscheiden. Nur für kleine Modelle oder Karten mit sehr viel Speicher vorsehen.
FP16
Volle Präzision, doppelt so groß wie Q8. Vor allem für das Fine-Tuning nützlich, für die Inferenz selten nötig.
→
Die Abwägung in einem Satz
Bei gleichem Speicherbedarf sollten Sie ein größeres Modell in Q4 einem kleineren Modell in Q8 vorziehen. Gehen Sie nur unter Q4, wenn es notwendig ist: Darunter nimmt die Qualität schnell ab.

#Warum ein kleines neueres Modell ein großes älteres schlägt

Das ist der Punkt, der Anfänger am meisten verwirrt: Ein 7B-LLM aus dem Jahr 2026 kann ein 70B-Modell aus dem Jahr 2023 übertreffen. Die Größe ist nur einer der Faktoren, die die Qualität bestimmen – und nicht immer der entscheidendste. Drei weitere Faktoren haben sich enorm verbessert.

Qualität der Daten
Neuere Modelle werden auf besser gefilterten, deduplizierten und mit hochwertigen synthetischen Daten angereicherten Korpora trainiert. Bei gleicher Größe lernen sie viel mehr.
Trainingsvolumen
Moderne 7B-Modelle sehen beim Training mehrere zehn Billionen Tokens, weit mehr als ältere große Modelle. Ein kleines, intensiv trainiertes Netzwerk übertrifft ein großes, unzureichend trainiertes Netzwerk.
Architektur und Post-Training
Bessere Architekturen, Alignment durch RLHF, gezieltes Training für das Schlussfolgern: All das bringt Verbesserungen, die nichts mit der Anzahl der Parameter zu tun haben.

Die Destillation spielt ebenfalls eine Schlüsselrolle: Das Wissen eines sehr großen Modells wird auf ein kleines übertragen, das einen Teil seiner Fähigkeiten bei einem Bruchteil seiner Größe übernimmt. So kann ein destilliertes 7B- oder 8B-Modell wie ein deutlich größeres Modell schlussfolgern. Die praktische Konsequenz: Achten Sie immer auf das Veröffentlichungsdatum und aktuelle Benchmarks, niemals allein auf die Anzahl der Parameter.

!
Die Marketingfalle
„Größer = besser“ gilt nicht uneingeschränkt. Die Qualität eines Modells hängt ebenso von seinen Daten, seinem Training und seiner Architektur ab wie von seiner Größe. Seien Sie skeptisch gegenüber Vergleichen, die lediglich die Milliarden von Parametern gegenüberstellen.

#Praktische Auswahl der Größe

Die richtige Größe ist die, die auf Ihre Hardware passt und zugleich Ihren Einsatzzweck abdeckt. Beginnen Sie mit dem größten aktuellen Modell, das in Q4 in Ihren VRAM passt, und passen Sie die Auswahl dann an Ihren tatsächlichen Bedarf an Geschwindigkeit oder differenzierten Antworten an.

  1. 01
    Messen Sie Ihren VRAM
    Ermitteln Sie die Speicherkapazität Ihrer GPU (oder des gemeinsamen Arbeitsspeichers auf dem Mac). Sie bildet die feste Obergrenze, durch die zu große Modelle von vornherein ausgeschlossen werden.
  2. 02
    Wählen Sie das größte aktuelle Modell, das in Q4 in den Speicher passt
    Bei 12 GB ein aktuelles 14B-Modell. Bei 24 GB ein 32B-Modell. Bei 8 GB ein gutes 7B-/8B-Modell. Ziehen Sie stets ein kürzlich erschienenes Modell einem älteren, größeren vor.
  3. 03
    Passen Sie die Auswahl an den Einsatzzweck an
    Alltagschats und Geschwindigkeit: Bleiben Sie bei 7B–14B. Für logisches Schlussfolgern, anspruchsvolle Programmieraufgaben und nuancierte Übersetzungen: Wechseln Sie zu 30B+, sofern der Speicher ausreicht.
  4. 04
    Prüfen Sie die Geschwindigkeit
    Wenn Sie der Durchsatz in Tokens pro Sekunde frustriert, gehen Sie eine Größenstufe herunter. Ein schnelles 7B-Modell ist bei interaktiver Nutzung oft besser als ein träges 32B-Modell.

#Zwei Größen in 5 Minuten vergleichen

Am besten erleben Sie den Unterschied, indem Sie Modelle zweier Größen auf Ihrem eigenen Rechner nebeneinander laufen lassen. Wenn Ollama installiert ist und auf seinem Standardport lauscht (http://localhost:11434), genügen zwei Befehle.

Terminal
# Un petit modèle rapide
ollama run llama3.2:3b --verbose

# Le même prompt sur un modèle plus gros
ollama run llama3.1:8b --verbose

Stellen Sie beiden dieselbe Denkaufgabe (zum Beispiel ein kleines Logikproblem mit mehreren Schritten) und vergleichen Sie die Qualität der Antworten sowie den mit --verbose angezeigten Durchsatz. So sehen Sie konkret, wo auf Ihrer Hardware der Kompromiss zwischen Fähigkeiten und Geschwindigkeit liegt.

i
Tokens pro Sekunde ablesen
Das Flag --verbose zeigt am Ende der Antwort die Anzahl der Tokens pro Sekunde an. Das ist die objektive Messgröße, um auf Ihrer eigenen GPU zwischen zwei Modellgrößen zu entscheiden.

#Weiterführende Informationen

Die Größe lässt sich besser verstehen, wenn man sie mit den anderen Grundlagen des lokalen Modellbetriebs in Verbindung bringt. Diese Leitfäden knüpfen direkt an diesen Leitfaden an:

Quantisierung wählen (Q4, Q5, Q8, FP16)
Die andere Hälfte der Abwägung beim Speicherbedarf: Wie sich ein Modell komprimieren lässt, ohne seine Qualität zu beeinträchtigen, erklärt ein visueller Leitfaden.
MoE erklärt: Warum ein 30B-A3B wie ein kleines Modell läuft
Die Schreibweise mit zwei Zahlen, die den Zusammenhang zwischen Größe und Geschwindigkeit aufbricht — direkt im Anschluss an diesen Leitfaden lesen.
Destillation: Wie kleine Modelle von großen erben
Um gründlich zu verstehen, warum ein kleines, neueres Modell ein großes, älteres Modell übertreffen kann.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.