Architektur eines LLM: Erklärung des Transformers simplement
Überall ist von „Transformer“, „Attention“ und „Parametern“ die Rede, ohne dass erklärt wird, was diese Begriffe bedeuten. Dieser Leitfaden wirft einen Blick unter die Haube eines LLM und erklärt seine Architektur mit einfachen Analogien, ohne eine einzige Gleichung. Am Ende werden Sie den inneren Aufbau eines LLM verstehen – und vor allem, warum diese Designentscheidungen bestimmen, wie viel VRAM das Modell benötigt und wie schnell es auf Ihrem Rechner antwortet.
#Warum die Architektur eines LLM verstehen?
Man kann einen LLM lokal laufen lassen, ohne etwas über sein internes Funktionieren zu wissen — ein ollama run suffit.. Doch sobald man den passenden Modell für seine Maschine wählen möchte, werden alle technischen Angaben zu Hindernissen: „32 Schichten“, „7 Milliarden Parameter“, „MoE 8x7B“, „Achtung bei 32 Heads“. Es sind diese Zahlen, die bestimmen, ob ein Modell auf Ihrer Grafikkarte passt oder auf Ihrem Prozessor zu viel verbraucht.
Die gute Nachricht: Die Architektur, die alle aktuellen LLM dominiert – der Transformer –, basiert auf einer Handvoll Ideen, die man ohne Mathematik erklären kann. Diese Ideen zu verstehen bedeutet, von „ich kopiere einen Befehl, ohne zu verstehen, was ich tue“ zu „ich weiß, warum dieses Modell 9 GB VRAM benötigt und nicht 40“ überzugehen.
#Der Transformer in einem Bild
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Ein modernes LLM ist ein Transformer: eine Maschine, die Text als Eingabe erhält und immer wieder das nächste Wort vorhersagt. Der Name stammt aus dem Artikel „Attention Is All You Need“ (Google, 2017), der diese Architektur eingeführt hat. Alle Modelle, denen Sie begegnen – Llama, Qwen, Mistral, Gemma, DeepSeek, Phi – sind Varianten davon.
Stellen Sie sich eine Montagelinie vor. Am Eingang liegt Ihr Satz, in einzelne Stücke zerlegt. Jede Station der Linie (eine „Schicht“) vertieft das Verständnis des Textes unter Berücksichtigung des Kontexts. Am Ausgang schlägt das Modell das wahrscheinlichste nächste Stück vor. Dieser Vorgang wird für jedes neu erzeugte Stück wiederholt. Das ist alles – der Rest sind nur Details dazu, was jede Station tut.
- Eingabe
- Ihr Text, in Tokens (kleine Teile von Wörtern) aufgeteilt.
- Schichtaufbau
- Jede Schicht verfeinert die Repräsentation des Textes. Ein Modell hat Dutzende solcher Schichten.
- Attention
- Der zentrale Mechanismus jeder Schicht: Er lässt jedes Wort auf die anderen „schauen“.
- Ausgabe
- Eine Wahrscheinlichkeit für jedes mögliche Token; das Modell wählt eines aus, fügt es dem Text hinzu und wiederholt den Vorgang.
#Von Ihren Wörtern zu Tokens
Ein LLM sieht keine Buchstaben und nicht einmal ganze Wörter: Es sieht Tokens. Ein Token ist ein häufiges Textfragment – manchmal ein ganzes kurzes Wort („chat“), manchmal ein Wortteil („anti“, „constitution“), manchmal ein Leerzeichen oder ein Satzzeichen. Im Französischen rechnen Sie grob mit 3 Tokens für 2 Wörter.
Jedes Token wird anschließend in eine Liste von Zahlen umgewandelt, die als „Embedding“ bezeichnet wird. Das ist die Übersetzung des Textes in eine Sprache, mit der die Maschine umgehen kann: Koordinaten in einem Raum, in dem Wörter mit ähnlicher Bedeutung auch räumlich nahe beieinanderliegen. „König“ und „Königin“ sind dort Nachbarn; „König“ und „Brokkoli“ liegen weit auseinander.
#Der Aufmerksamkeitsmechanismus, das Herz des Transformers
Attention ist die Idee, die alles verändert hat. Nehmen Sie den Satz: „Die Maus hat den Käse gegessen, weil sie hungrig war.“ Auf wen bezieht sich „sie“? Natürlich auf die Maus. Um das zu erkennen, muss man „sie“ mit dem mehrere Wörter zuvor stehenden Wort „Maus“ verknüpfen. Genau das macht Attention: Für jedes Wort entscheidet sie, welche anderen Wörter im Satz relevant sind und wie stark sie berücksichtigt werden.
Analogie: Wenn Sie bei einer Besprechung ein mehrdeutiges Pronomen hören, geht Ihr Gehirn das zuvor Gesagte durch, um herauszufinden, von wem die Rede ist. Der Aufmerksamkeitsmechanismus macht dasselbe, parallel für alle Wörter gleichzeitig. Jedes Wort „stellt eine Frage“ (was brauche ich, um verstanden zu werden?) und „erhält Antworten“ von den anderen Wörtern, gewichtet nach ihrer Relevanz.
Man spricht oft von „Aufmerksamkeitsköpfen“ (attention heads). Ein Kopf betrachtet Beziehungen auf eine bestimmte Weise; mehrere Köpfe (32, 64 …) ermöglichen es dem Modell, verschiedene Arten von Verbindungen gleichzeitig zu verfolgen — etwa die Grammatik, das Thema des Textes und zeitliche Bezüge.
#Gestapelte Schichten
Eine einzelne Attention-Schicht versteht einfache Beziehungen. Die Leistungsfähigkeit entsteht durch das Stapeln der Schichten: Die Ausgabe einer Schicht wird zur Eingabe der nächsten. Ein kleines Modell hat etwa zwanzig davon, ein großes mehrere Dutzend. Jede Schicht kombiniert zwei Blöcke: Attention (die Wörter miteinander verknüpft) und ein „Feedforward“-Netzwerk (das jedes Wort einzeln verarbeitet, wie ein Mini-Gehirn, das über das gerade Gelesene nachdenkt).
Analogie: Lesen auf mehreren Ebenen. Die erste Schicht erkennt Wörter und Grammatik. Die mittleren Schichten erschließen die Bedeutung der Sätze. Die letzten erfassen die Absicht, den Ton und das, was als Nächstes kommen soll. Je mehr Schichten es gibt, desto tiefer kann das Modell schlussfolgern — aber desto mehr Berechnungen sind für jedes generierte Token nötig.
- Attention-Block
- Verbindet Wörter miteinander (der Kontext).
- Feed-forward-Block
- Transformiert jedes Wort tiefgreifend (das „Wissen“ des Modells).
- Anzahl der Schichten
- Die „Tiefe“. Je mehr davon vorhanden sind, desto leistungsfähiger ist das Modell — und desto langsamer.
- Breite (Hidden Dimension)
- Die Länge der Zahlenlisten. Je länger sie ist, desto breiter und schwerer ist das Modell.
#Was genau sind die Parameter?
Wenn man „7B“ oder „70B“ liest, steht das B für „Milliarden“ (englisch billion) und bezeichnet die Anzahl der Parameter. Ein Parameter ist eine einstellbare Zahl innerhalb des Modells – einer der unzähligen Regler, die während des Trainings angepasst werden. Diese Regler codieren alles, was das Modell „weiß“: Grammatik, Fakten, Stile, Schlussfolgerungen.
Analogie: Stellen Sie sich ein riesiges Mischpult mit Milliarden von Schiebereglern vor. Beim Training wird jeder Regler so eingestellt, dass das Modell bei Milliarden von Textbeispielen das richtige nächste Wort vorhersagt. Sobald diese Einstellungen feststehen, bilden sie die „Gewichte“ (weights), die Sie herunterladen, wenn Sie ollama pull ausführen.
Je mehr Parameter ein Modell hat, desto mehr kann es sich merken und desto differenzierter kann es antworten — aber desto mehr Speicher belegt es und desto langsamer ist es, weil jedes generierte Token all diese Parameter durchläuft. Das ist der direkte Zusammenhang zwischen der Zahl „7B“ und den Hardwareanforderungen an Ihren Rechner.
#Dense vs. MoE: zwei Arten, das Modell zu verschalten
Bislang haben wir einen „dichten“ Transformer beschrieben: Jedes Token durchläuft sämtliche Parameter. Einfach, aber kostspielig – ein dichtes 70B-Modell nutzt bei jedem generierten Wort seine 70 Milliarden Parameter.
Die MoE-Architektur (Mixture of Experts) durchbricht diese Regel. Statt eines einzigen großen Feed-Forward-Blocks pro Schicht verwendet sie mehrere (die „Experten“) und aktiviert für jedes Token nur einige davon, die eine kleine Vermittlungsinstanz (der „Router“) auswählt. Als Analogie: Statt eines Allgemeinmediziners, der auf alles antwortet, gibt es eine Facharztpraxis, in der Sie nur die beiden für Ihren Fall zuständigen Ärzte konsultieren.
- Dense
- Alle Parameter arbeiten pro Token. Beispiele: Llama 3 8B, Qwen 14B, Gemma 27B.
- MoE
- Viele Parameter insgesamt, aber nur wenige pro Token aktiv. Beispiele: Mixtral 8x7B, DeepSeek V3, Llama 4 Scout.
- MoE-Notation
- « 30B-A3B » = insgesamt 30 Milliarden Parameter, aber nur 3 Milliarden aktive (A = aktiv) pro Token.
Für den lokalen Einsatz hat das weitreichende Folgen: Ein MoE verhält sich hinsichtlich der Geschwindigkeit wie ein kleines Modell (wenige aktive Parameter), behält aber das breite Wissen eines großen Modells (viele Parameter insgesamt). Der Haken ist der VRAM: Alle Experten müssen in den Speicher geladen werden, auch wenn jeweils nur ein Bruchteil davon aktiviert wird.
#Warum all das den VRAM-Bedarf und die Geschwindigkeit bestimmt
Damit kommen wir zum entscheidenden praktischen Punkt. Beim lokalen Betrieb zählen zwei Ressourcen: Speicher (damit das Modell hineinpasst) und Rechenleistung (für schnelle Antworten). Die Architektur bestimmt beide.
#Der Speicher: Die Modellgewichte müssen hineinpassen
Um schnell zu laufen, muss ein Modell vollständig in den VRAM Ihrer GPU passen (oder in den vereinheitlichten Speicher eines Macs mit Apple Silicon). Andernfalls wird ein Teil auf die CPU und in den RAM ausgelagert, und die Geschwindigkeit bricht ein. Die Größe hängt von der Parameterzahl und der Quantisierung ab.
- 3B in Q4
- ≈ 2 GB VRAM
- 7B in Q4
- ≈ 5 GB
- 14B in Q4
- ≈ 9 GB
- 32B in Q4
- ≈ 19 GB
- 70B in Q4
- ≈ 40 GB
Rechnen Sie den Speicher für den Kontext (den KV-Cache) hinzu, der mit der Länge des Prompts wächst. Ein langer Kontext kann mehrere zusätzliche Gigabyte erfordern – das sollten Sie nicht vergessen, wenn Sie bereits an der Kapazitätsgrenze Ihrer Grafikkarte liegen.
#Die Geschwindigkeit: wie viele Parameter pro Token aktiv sind
Die Generationsgeschwindigkeit (Tokens pro Sekunde) hängt vor allem von den Parametern ab, die bei jedem Token tatsächlich aktiviert werden. Deshalb können ein dichtes 8B-Modell und ein 30B-A3B-MoE-Modell eine vergleichbare Geschwindigkeit aufweisen: Beide aktivieren pro Token nur etwa 3 bis 8 Milliarden Parameter. Das MoE-Modell benötigt lediglich deutlich mehr VRAM, um alle seine Experten unterzubringen.
- RTX 3060 12 GB
- Für Modelle bis 14B in Q4 gut geeignet. Eine ideale Einsteigerkarte.
- RTX 4070 / 4080 (12–16 GB)
- 14B problemlos, für 32B in Q4 wird es auf der 4080 knapp.
- RTX 4090 24 GB
- 32B in Q4 komfortabel, 70B auf reinem GPU-System außer Reichweite
- Mac M4 Pro mit 24–48 GB gemeinsamem Speicher
- Der vereinheitlichte Speicher dient als VRAM: Auf Konfigurationen mit 48 GB lässt sich bis zu einem 70B-Modell in Q4 ausführen.
#Modellbeschreibung zeilenweise lesen
Sie haben jetzt das nötige Wissen, um ein technisches Datenblatt zu verstehen. Nehmen wir ein typisches Beispiel, wie man es auf Hugging Face oder in der Ollama-Bibliothek findet:
- Architektur: Decoder-only
- Der Standard bei generativen LLMs: Das Modell sagt lediglich die Fortsetzung des Textes voraus (kein separater „Encoder“-Teil).
- Parameter: 14B
- 14 Milliarden Parameter. Speicherbedarf: ~9 GB bei Q4, mindestens eine Karte mit 12 GB erforderlich.
- Typ: dense
- Alle Parameter sind bei jedem Token aktiv. Wenn es ein MoE wäre, würden Sie eine Angabe wie 30B-A3B sehen.
- layers: 40
- 40 übereinandergestapelte Schichten. Das ist die Tiefe: Je mehr Schichten es gibt, desto differenzierter ist das Schlussfolgern und desto langsamer läuft das Modell.
- attention_heads: 40
- 40 Aufmerksamkeitsköpfe pro Schicht – so viele Möglichkeiten, Wörter parallel miteinander zu verbinden.
- context_length: 32768
- 32k Tokens Kontext, also etwa 24.000 Wörter. Achtung: Das Füllen dieses Kontexts verbraucht zusätzlich VRAM.
- Quantisierung: Q4_K_M
- Auf ~4 Bit pro Parameter reduzierte Präzision. Der beste Kompromiss zwischen Qualität und Größe für den lokalen Einsatz.
- size_on_disk: 9 GB
- Das, was Sie herunterladen und was in den Speicher geladen werden muss, um die maximale Geschwindigkeit zu erreichen.
Mit diesen sieben Zeilen können Sie bereits die einzige Frage beantworten, die zählt: „Läuft das gut auf meinem Rechner?“ Hier: 14B in Q4 = ~9 GB Modellgewichte + Kontext → eine RTX 3060 mit 12 GB oder besser, und es läuft schnell.
#Weiterführende Informationen
Sie kennen nun die Anatomie eines LLM. Drei Leitfäden bauen auf diesen Grundlagen auf: Der erste erläutert die MoE-Notation und ihre konkreten Auswirkungen, der zweite erklärt die Wahl der Quantisierung, die den Speicherbedarf auf dem Datenträger bestimmt, und der dritte greift das hier angesprochene Kontextfenster wieder auf.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.