MoE erklärt: Warum ein 30B-A3B wie ein kleines Modell
Seit 2025 haben die meisten großen Open-Weight-Veröffentlichungen eines gemeinsam: Es sind Mixture-of-Experts-Modelle, kurz MoE. Immer wieder begegnet man Namen wie Qwen3 30B-A3B, gpt-oss 120B oder Llama 4 Scout 17B-A2B mit dieser rätselhaften Notation aus zwei Zahlen. Die Grundidee ist einfach: Ein MoE-Modell enthält viele Parameter, aktiviert aber bei jedem Token nur einen kleinen Bruchteil davon. Dadurch kann ein Modell mit „30 Milliarden“ Parametern mit der Geschwindigkeit eines Modells mit 3 Milliarden Parametern laufen. Dieser Leitfaden erklärt den Mechanismus, entschlüsselt die Notation und beschreibt ausführlich die tatsächlichen Auswirkungen auf Ihren VRAM und Ihren Durchsatz.
#Das Problem, das das MoE löst
Ein klassisches Sprachmodell wird als „dicht“ bezeichnet: Um jedes Wort zu erzeugen, verarbeitet es Ihren Text unter Einsatz sämtlicher Parameter. Ein dichtes 32B-Modell nutzt bei jedem Token seine 32 Milliarden Parameter. Das macht es leistungsfähig, aber auch langsam und ressourcenhungrig: Je mehr Parameter es hat, desto mehr Rechenleistung und Speicher benötigt es – daran führt kein Weg vorbei.
Darin liegt das Dilemma beim lokalen Betrieb. Man möchte das Wissen und die Differenziertheit eines großen Modells, aber die Geschwindigkeit und den sparsamen Ressourcenverbrauch eines kleinen. Auf einer Grafikkarte für den Verbrauchermarkt ist ein dichtes Modell mit 70 Milliarden Parametern entweder außer Reichweite oder quälend langsam. Mixture of Experts löst diesen Zielkonflikt auf, indem es zwei Dinge voneinander trennt, die man für untrennbar hielt: die Größe des Modells und den Rechenaufwand pro Token.
#Das Prinzip: Experten, die bei Bedarf aktiviert werden
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
In einem Mixture-of-Experts-Modell bilden die großen Rechenschichten keinen einzelnen Block mehr, sondern bestehen aus einer Gruppe von Teilnetzen, die „Experten“ genannt werden. Ein Modell kann 64, 128 oder manchmal noch mehr davon enthalten. Bei jedem verarbeiteten Token betrachtet eine kleine Vermittlungsinstanz — der „Router“ — den Kontext und wählt nur 2, 4 oder 8 Experten zur Aktivierung aus. Die übrigen Experten führen für dieses Token keine Berechnungen durch.
Anders als der Begriff vermuten lässt, sind diese Experten nicht auf bestimmte Themen spezialisiert: Es gibt keinen „Experten für Französisch“ oder „Experten für Code“. Der Router wird gleichzeitig mit dem Modell trainiert und verteilt die Arbeit anhand statistischer Muster, die niemand manuell steuert. Von einem Token zum nächsten ändert sich die Auswahl. Im Verlauf eines ganzen Satzes kommen schließlich fast alle Experten zum Einsatz, aber niemals alle gleichzeitig.
- Experten
- Spezialisierte Teilnetze, die alle im Speicher liegen, von denen aber bei jedem Token nur eine Minderheit aktiv ist.
- Router (Gating)
- Die leichtgewichtige Komponente, die Token für Token entscheidet, welche Experten aktiviert werden.
- Aktive Experten
- Die Anzahl der Experten, die pro Token aktiviert werden, meistens 2 bis 8. Dieser Wert bestimmt die Geschwindigkeit.
- Aktive Parameter
- Die Gesamtzahl der tatsächlich pro Token genutzten Parameter – der Anteil, der für die Berechnung zählt.
#Die Notation 30B-A3B entschlüsseln
Die Schreibweise, die Anfänger verwirrt, ist eigentlich leicht zu verstehen, sobald man weiß, wie sie zu lesen ist. Nehmen Sie Qwen3 30B-A3B: Die erste Zahl steht für die Gesamtzahl der Parameter des Modells, die zweite (nach dem „A“ für Active) für die Anzahl der aktiven Parameter pro Token.
- 30B
- Das Modell enthält insgesamt 30 Milliarden Parameter. Diese Zahl bestimmt, wie viel Speicher zum Laden des Modells benötigt wird.
- A3B
- Nur etwa 3 Milliarden Parameter sind bei jedem Token aktiv. Das bestimmt die Generierungsgeschwindigkeit.
Anders ausgedrückt bedeutet 30B-A3B „30 Milliarden in Reserve, 3 Milliarden im Einsatz“. Das Modell hat den Wissensreichtum eines 30B-Modells, generiert aber ungefähr so schnell wie ein dichtes 3B-Modell. Dieselbe Logik gilt für alle anderen neueren Modellveröffentlichungen.
- Qwen3 30B-A3B
- 30 Milliarden insgesamt, 3 Milliarden aktiv – das MoE-Modell für die breite Öffentlichkeit schlechthin.
- Llama 4 Scout 17B-A2B
- Insgesamt 17 Milliarden Parameter, davon etwa 2 Milliarden pro Token aktiv, zusätzlich mit multimodalen Fähigkeiten.
- gpt-oss 120B
- Insgesamt 120 Milliarden, aber nur etwa 5 Milliarden aktiv — daher die für seine Größe überraschend hohe Geschwindigkeit.
- DeepSeek V3.2 671B-A37B
- 671 Milliarden auf Reserve, 37 Milliarden aktiv: ein Riese, der pro Token „nur so viel kostet“ wie ein mittelgroßes Modell.
#VRAM: Was sich wirklich ändert
Das ist der Punkt, der am häufigsten missverstanden wird. Deshalb stellen wir ihn klar: Alle Experten eines MoE müssen in den Speicher geladen werden, weil der Router beim nächsten Token jeden beliebigen Experten aufrufen kann. Der benötigte VRAM hängt daher von der Gesamtzahl der Parameter ab, nicht von der Zahl der aktiven Parameter. Für ein 30B-A3B muss genauso viel Speicher eingeplant werden wie für ein dichtes Modell mit 30 Milliarden Parametern.
- Qwen3 30B-A3B in Q4_K_M
- ≈ 18–19 GB VRAM, wie bei einem dichten 32B-Modell. Es ist daher für eine RTX 4090 mit 24 GB ausgelegt; auf kleineren Karten wird ein Teil in den Arbeitsspeicher ausgelagert.
- Llama 4 Scout 17B-A2B in Q4
- ≈ 10–11 GB, passt auf eine RTX 4070 mit 12 GB oder eine 3060 mit 12 GB.
- gpt-oss 120B
- Mehrere Dutzend GB: nur für leistungsstarke Systeme oder für die Auslagerung in RAM bzw. auf SSD.
Der Vorteil von MoE im lokalen Betrieb liegt also nicht beim Speicher, sondern beim Verhältnis von Qualität zu Geschwindigkeit bei gleicher VRAM-Kapazität. Wo ein dichtes 30B-Modell auf Ihrer Karte nur schleppend läuft, belegt ein MoE 30B-A3B genauso viel Speicher, generiert aber deutlich schneller. Und weil inaktive Experten nicht bei jedem Token benötigt werden, verkraften MoE-Modelle es oft gut, wenn ein Teil der Gewichte in den Arbeitsspeicher ausgelagert wird: Der auf der GPU verbleibende Teil wird vorrangig genutzt.
#Geschwindigkeit: Warum es schnell ist
Die Generierungsgeschwindigkeit eines LLM hängt vor allem von der Anzahl der Parameter ab, die bei jedem Token durchlaufen werden. Da ein MoE nur einen kleinen Bruchteil davon aktiviert, sinkt der Rechenaufwand pro Token drastisch. Konkret erzeugt ein 30B-A3B Tokens etwa so schnell wie ein dichtes 3B-Modell und antwortet dabei mit der Tiefe eines 30B-Modells.
Genau das erklärt die Welle von MoE-Modellen auf bescheiden ausgestatteten Systemen: Man erhält die Qualität eines großen Modells, ohne dessen geringere Geschwindigkeit in Kauf nehmen zu müssen. Der Preis dafür liegt anderswo – wie bereits gesehen beim Arbeitsspeicher und beim höheren Speicherplatzbedarf auf der Festplatte beim Herunterladen, da alle Experten gespeichert werden müssen.
- Das beschleunigt
- Wenige aktive Parameter pro Token → weniger Rechenaufwand → mehr Tokens pro Sekunde.
- Das, was sich nicht ändert
- Der VRAM-Bedarf und die Dateigröße, die sich nach der Gesamtzahl der Parameter richten.
- Der Nettovorteil
- Bei gleicher Speicherkapazität bietet ein MoE mehr Wissen bei einer Geschwindigkeit, die mit der eines deutlich kleineren dichten Modells vergleichbar ist.
#Grenzen, die Sie kennen sollten
MoE ist kein Wundermittel und macht dichte Modelle nicht überflüssig. Bei gleicher Anzahl aktiver Parameter ist ein dichtes Modell beim differenzierten Schlussfolgern in der Regel etwas überlegen: Ein 30B-A3B ist hervorragend, aber ein echtes dichtes 30B-Modell, das bei jedem Token seine gesamten 30 Milliarden Parameter aktivieren würde, wäre leistungsfähiger – allerdings um den Preis einer für den lokalen Betrieb unzumutbaren Langsamkeit.
- Speicherbedarf nicht reduziert
- Es wird genügend VRAM für das gesamte Modell benötigt. Auch mit MoE passt ein großes Modell nicht auf eine Grafikkarte mit wenig Speicher.
- Aktive Qualität pro Token
- Bei einer vergleichbaren Anzahl aktiver Parameter hat ein gut trainiertes dichtes Modell bei besonders anspruchsvollen Schlussfolgerungsaufgaben oft weiterhin die Nase vorn.
- Größerer Download
- Alle Experten sind gespeichert: Die GGUF-Datei enthält die gesamte Menge, nicht nur den aktiven Teil.
- Empfindlichkeit gegenüber Quantisierung
- Der Router und einige Experten vertragen eine zu aggressive Quantisierung schlecht; bleiben Sie bei Q4_K_M oder höher.
#Die führenden MoE-Modelle zum lokalen Ausprobieren
Hier sind die Mixture-of-Experts-Modelle, die sich 2026 am ehesten zum Testen zu Hause eignen, von den am leichtesten zugänglichen bis zu den anspruchsvollsten.
- Qwen3 30B-A3B
- Der beste Einstieg. Solide Leistung bei allgemeinen Aufgaben und beim Programmieren, bemerkenswerte Geschwindigkeit, ca. 18 GB in Q4. Das Referenzmodell für den Einstieg in MoE.
- Llama 4 Scout 17B-A2B
- Multimodales MoE (Text + Bild) mit langem Kontext und geringerem VRAM-Bedarf. Ideal, wenn Sie eine Karte mit 12 GB haben.
- gpt-oss 120B
- Das Open-Weight-Modell von OpenAI mit nur ~5 Milliarden aktiven Parametern: verblüffend schnell für seine Größe, benötigt aber leistungsstarke Hardware.
- DeepSeek V3.2 671B-A37B
- Das Monster. Nur für Setups mit viel RAM und umfangreichem Offloading, für alle, die neugierig auf die Spitzenklasse sind.
Wenn Sie gerade anfangen, beginnen Sie mit Qwen3 30B-A3B: Dieses MoE-Modell zeigt am besten, welchen Nutzen die Architektur auf einer einzigen Consumer-Grafikkarte bietet.
#Ein MoE in 3 Minuten ausprobieren
Wenn Ollama bereits installiert ist und auf seinem Standardport läuft, reichen zwei Befehle aus, um den Unterschied zwischen einem MoE und einem dichten Modell zu spüren.
- 01Ein MoE herunterladen und startenLaden Sie Qwen3 30B-A3B herunter und chatten Sie sofort damit. Beim ersten Start wird das Modell heruntergeladen (rechnen Sie mit mehreren GB).
- 02Die Geschwindigkeit beobachtenStellen Sie eine etwas lange Frage und notieren Sie die Geschwindigkeit. Trotz seiner 30 Milliarden Parameter antwortet es sofort, mit der Geschwindigkeit eines kleinen Modells.
- 03Mit einem dichten Modell vergleichenStarten Sie ein dichtes Modell ähnlicher Größe und stellen Sie dieselbe Frage. Das MoE-Modell sollte bei vergleichbarem VRAM-Bedarf deutlich schneller generieren.
#Weiterführende Informationen
MoE lässt sich besser verstehen, wenn man es mit den anderen Grundlagen lokaler KI verknüpft. Diese Leitfäden knüpfen direkt an diesen an:
- Quantisierung wählen (Q4, Q5, Q8, FP16)
- MoE reagiert empfindlich auf eine zu aggressive Quantisierung: Dieser Leitfaden hilft, den richtigen Kompromiss zwischen Qualität und Speicherbedarf zu finden.
- Ollama installieren: Windows, macOS und Linux
- Um den lokalen Daemon auf Port 11434 einzurichten, bevor Sie Ihr erstes MoE-Modell herunterladen.
- Llama 4 Scout lokal: Installation und erste Tests mit Ollama
- Ein multimodales MoE-Modell, Schritt für Schritt erklärt, um die Theorie dieses Leitfadens in der Praxis zu sehen.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.