Einsteiger 8 minKonzepte

MoE erklärt: Warum ein 30B-A3B wie ein kleines Modell

Seit 2025 haben die meisten großen Open-Weight-Veröffentlichungen eines gemeinsam: Es sind Mixture-of-Experts-Modelle, kurz MoE. Immer wieder begegnet man Namen wie Qwen3 30B-A3B, gpt-oss 120B oder Llama 4 Scout 17B-A2B mit dieser rätselhaften Notation aus zwei Zahlen. Die Grundidee ist einfach: Ein MoE-Modell enthält viele Parameter, aktiviert aber bei jedem Token nur einen kleinen Bruchteil davon. Dadurch kann ein Modell mit „30 Milliarden“ Parametern mit der Geschwindigkeit eines Modells mit 3 Milliarden Parametern laufen. Dieser Leitfaden erklärt den Mechanismus, entschlüsselt die Notation und beschreibt ausführlich die tatsächlichen Auswirkungen auf Ihren VRAM und Ihren Durchsatz.

Von Mohamed Meguedmi·Aktualisierung 2026-08-02·Unter Windows, macOS und Linux getestet

#Das Problem, das das MoE löst

Ein klassisches Sprachmodell wird als „dicht“ bezeichnet: Um jedes Wort zu erzeugen, verarbeitet es Ihren Text unter Einsatz sämtlicher Parameter. Ein dichtes 32B-Modell nutzt bei jedem Token seine 32 Milliarden Parameter. Das macht es leistungsfähig, aber auch langsam und ressourcenhungrig: Je mehr Parameter es hat, desto mehr Rechenleistung und Speicher benötigt es – daran führt kein Weg vorbei.

Darin liegt das Dilemma beim lokalen Betrieb. Man möchte das Wissen und die Differenziertheit eines großen Modells, aber die Geschwindigkeit und den sparsamen Ressourcenverbrauch eines kleinen. Auf einer Grafikkarte für den Verbrauchermarkt ist ein dichtes Modell mit 70 Milliarden Parametern entweder außer Reichweite oder quälend langsam. Mixture of Experts löst diesen Zielkonflikt auf, indem es zwei Dinge voneinander trennt, die man für untrennbar hielt: die Größe des Modells und den Rechenaufwand pro Token.

i
Die Grundidee in einem Satz
Ein dichtes Modell lässt bei jeder Frage alle mitarbeiten. Ein MoE weckt nur die wenigen zuständigen Spezialisten und lässt die anderen schlafen.

#Das Prinzip: Experten, die bei Bedarf aktiviert werden

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

In einem Mixture-of-Experts-Modell bilden die großen Rechenschichten keinen einzelnen Block mehr, sondern bestehen aus einer Gruppe von Teilnetzen, die „Experten“ genannt werden. Ein Modell kann 64, 128 oder manchmal noch mehr davon enthalten. Bei jedem verarbeiteten Token betrachtet eine kleine Vermittlungsinstanz — der „Router“ — den Kontext und wählt nur 2, 4 oder 8 Experten zur Aktivierung aus. Die übrigen Experten führen für dieses Token keine Berechnungen durch.

Anders als der Begriff vermuten lässt, sind diese Experten nicht auf bestimmte Themen spezialisiert: Es gibt keinen „Experten für Französisch“ oder „Experten für Code“. Der Router wird gleichzeitig mit dem Modell trainiert und verteilt die Arbeit anhand statistischer Muster, die niemand manuell steuert. Von einem Token zum nächsten ändert sich die Auswahl. Im Verlauf eines ganzen Satzes kommen schließlich fast alle Experten zum Einsatz, aber niemals alle gleichzeitig.

Experten
Spezialisierte Teilnetze, die alle im Speicher liegen, von denen aber bei jedem Token nur eine Minderheit aktiv ist.
Router (Gating)
Die leichtgewichtige Komponente, die Token für Token entscheidet, welche Experten aktiviert werden.
Aktive Experten
Die Anzahl der Experten, die pro Token aktiviert werden, meistens 2 bis 8. Dieser Wert bestimmt die Geschwindigkeit.
Aktive Parameter
Die Gesamtzahl der tatsächlich pro Token genutzten Parameter – der Anteil, der für die Berechnung zählt.
→
Ein mentales Bild
Stellen Sie sich eine Praxis mit 128 Ärzten vor. Der Patient wird von einem Disponenten empfangen, der ihn an die 4 relevanten Spezialisten weiterleitet. Die Praxis ist riesig (viel verfügbares Wissen), aber jede Konsultation bindet nur 4 Personen (geringe Kosten pro Patient).

#Die Notation 30B-A3B entschlüsseln

Die Schreibweise, die Anfänger verwirrt, ist eigentlich leicht zu verstehen, sobald man weiß, wie sie zu lesen ist. Nehmen Sie Qwen3 30B-A3B: Die erste Zahl steht für die Gesamtzahl der Parameter des Modells, die zweite (nach dem „A“ für Active) für die Anzahl der aktiven Parameter pro Token.

30B
Das Modell enthält insgesamt 30 Milliarden Parameter. Diese Zahl bestimmt, wie viel Speicher zum Laden des Modells benötigt wird.
A3B
Nur etwa 3 Milliarden Parameter sind bei jedem Token aktiv. Das bestimmt die Generierungsgeschwindigkeit.

Anders ausgedrückt bedeutet 30B-A3B „30 Milliarden in Reserve, 3 Milliarden im Einsatz“. Das Modell hat den Wissensreichtum eines 30B-Modells, generiert aber ungefähr so schnell wie ein dichtes 3B-Modell. Dieselbe Logik gilt für alle anderen neueren Modellveröffentlichungen.

Qwen3 30B-A3B
30 Milliarden insgesamt, 3 Milliarden aktiv – das MoE-Modell für die breite Öffentlichkeit schlechthin.
Llama 4 Scout 17B-A2B
Insgesamt 17 Milliarden Parameter, davon etwa 2 Milliarden pro Token aktiv, zusätzlich mit multimodalen Fähigkeiten.
gpt-oss 120B
Insgesamt 120 Milliarden, aber nur etwa 5 Milliarden aktiv — daher die für seine Größe überraschend hohe Geschwindigkeit.
DeepSeek V3.2 671B-A37B
671 Milliarden auf Reserve, 37 Milliarden aktiv: ein Riese, der pro Token „nur so viel kostet“ wie ein mittelgroßes Modell.
!
Die Falle beim Lesen
Die zweite Zahl reduziert den Speicher nicht: Ein 30B-A3B belegt den Platz eines 30B, nicht eines 3B. Das „A3B“ beschleunigt die Berechnung, komprimiert aber nicht das Modell. Das ist Verwirrung Nr. 1 bei Anfängern.

#VRAM: Was sich wirklich ändert

Das ist der Punkt, der am häufigsten missverstanden wird. Deshalb stellen wir ihn klar: Alle Experten eines MoE müssen in den Speicher geladen werden, weil der Router beim nächsten Token jeden beliebigen Experten aufrufen kann. Der benötigte VRAM hängt daher von der Gesamtzahl der Parameter ab, nicht von der Zahl der aktiven Parameter. Für ein 30B-A3B muss genauso viel Speicher eingeplant werden wie für ein dichtes Modell mit 30 Milliarden Parametern.

Qwen3 30B-A3B in Q4_K_M
≈ 18–19 GB VRAM, wie bei einem dichten 32B-Modell. Es ist daher für eine RTX 4090 mit 24 GB ausgelegt; auf kleineren Karten wird ein Teil in den Arbeitsspeicher ausgelagert.
Llama 4 Scout 17B-A2B in Q4
≈ 10–11 GB, passt auf eine RTX 4070 mit 12 GB oder eine 3060 mit 12 GB.
gpt-oss 120B
Mehrere Dutzend GB: nur für leistungsstarke Systeme oder für die Auslagerung in RAM bzw. auf SSD.

Der Vorteil von MoE im lokalen Betrieb liegt also nicht beim Speicher, sondern beim Verhältnis von Qualität zu Geschwindigkeit bei gleicher VRAM-Kapazität. Wo ein dichtes 30B-Modell auf Ihrer Karte nur schleppend läuft, belegt ein MoE 30B-A3B genauso viel Speicher, generiert aber deutlich schneller. Und weil inaktive Experten nicht bei jedem Token benötigt werden, verkraften MoE-Modelle es oft gut, wenn ein Teil der Gewichte in den Arbeitsspeicher ausgelagert wird: Der auf der GPU verbleibende Teil wird vorrangig genutzt.

i
VRAM-Richtwert bei Q4
3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Bei einem MoE gelten diese Richtwerte für die erste Zahl (die Gesamtzahl), nie für die aktive Zahl.

#Geschwindigkeit: Warum es schnell ist

Die Generierungsgeschwindigkeit eines LLM hängt vor allem von der Anzahl der Parameter ab, die bei jedem Token durchlaufen werden. Da ein MoE nur einen kleinen Bruchteil davon aktiviert, sinkt der Rechenaufwand pro Token drastisch. Konkret erzeugt ein 30B-A3B Tokens etwa so schnell wie ein dichtes 3B-Modell und antwortet dabei mit der Tiefe eines 30B-Modells.

Genau das erklärt die Welle von MoE-Modellen auf bescheiden ausgestatteten Systemen: Man erhält die Qualität eines großen Modells, ohne dessen geringere Geschwindigkeit in Kauf nehmen zu müssen. Der Preis dafür liegt anderswo – wie bereits gesehen beim Arbeitsspeicher und beim höheren Speicherplatzbedarf auf der Festplatte beim Herunterladen, da alle Experten gespeichert werden müssen.

Das beschleunigt
Wenige aktive Parameter pro Token → weniger Rechenaufwand → mehr Tokens pro Sekunde.
Das, was sich nicht ändert
Der VRAM-Bedarf und die Dateigröße, die sich nach der Gesamtzahl der Parameter richten.
Der Nettovorteil
Bei gleicher Speicherkapazität bietet ein MoE mehr Wissen bei einer Geschwindigkeit, die mit der eines deutlich kleineren dichten Modells vergleichbar ist.

#Grenzen, die Sie kennen sollten

MoE ist kein Wundermittel und macht dichte Modelle nicht überflüssig. Bei gleicher Anzahl aktiver Parameter ist ein dichtes Modell beim differenzierten Schlussfolgern in der Regel etwas überlegen: Ein 30B-A3B ist hervorragend, aber ein echtes dichtes 30B-Modell, das bei jedem Token seine gesamten 30 Milliarden Parameter aktivieren würde, wäre leistungsfähiger – allerdings um den Preis einer für den lokalen Betrieb unzumutbaren Langsamkeit.

Speicherbedarf nicht reduziert
Es wird genügend VRAM für das gesamte Modell benötigt. Auch mit MoE passt ein großes Modell nicht auf eine Grafikkarte mit wenig Speicher.
Aktive Qualität pro Token
Bei einer vergleichbaren Anzahl aktiver Parameter hat ein gut trainiertes dichtes Modell bei besonders anspruchsvollen Schlussfolgerungsaufgaben oft weiterhin die Nase vorn.
Größerer Download
Alle Experten sind gespeichert: Die GGUF-Datei enthält die gesamte Menge, nicht nur den aktiven Teil.
Empfindlichkeit gegenüber Quantisierung
Der Router und einige Experten vertragen eine zu aggressive Quantisierung schlecht; bleiben Sie bei Q4_K_M oder höher.
→
So wählen Sie in der Praxis
Knapp bemessener VRAM und Bedarf an hoher Geschwindigkeit bei gutem Wissensstand? Hier spielt ein MoE seine Stärken aus. Hat möglichst differenziertes Schlussfolgern bei reichlich VRAM Priorität? Dann kann sich ein dichtes Modell mit einer vergleichbaren Anzahl aktiver Parameter eher lohnen.

#Die führenden MoE-Modelle zum lokalen Ausprobieren

Hier sind die Mixture-of-Experts-Modelle, die sich 2026 am ehesten zum Testen zu Hause eignen, von den am leichtesten zugänglichen bis zu den anspruchsvollsten.

Qwen3 30B-A3B
Der beste Einstieg. Solide Leistung bei allgemeinen Aufgaben und beim Programmieren, bemerkenswerte Geschwindigkeit, ca. 18 GB in Q4. Das Referenzmodell für den Einstieg in MoE.
Llama 4 Scout 17B-A2B
Multimodales MoE (Text + Bild) mit langem Kontext und geringerem VRAM-Bedarf. Ideal, wenn Sie eine Karte mit 12 GB haben.
gpt-oss 120B
Das Open-Weight-Modell von OpenAI mit nur ~5 Milliarden aktiven Parametern: verblüffend schnell für seine Größe, benötigt aber leistungsstarke Hardware.
DeepSeek V3.2 671B-A37B
Das Monster. Nur für Setups mit viel RAM und umfangreichem Offloading, für alle, die neugierig auf die Spitzenklasse sind.

Wenn Sie gerade anfangen, beginnen Sie mit Qwen3 30B-A3B: Dieses MoE-Modell zeigt am besten, welchen Nutzen die Architektur auf einer einzigen Consumer-Grafikkarte bietet.

#Ein MoE in 3 Minuten ausprobieren

Wenn Ollama bereits installiert ist und auf seinem Standardport läuft, reichen zwei Befehle aus, um den Unterschied zwischen einem MoE und einem dichten Modell zu spüren.

  1. 01
    Ein MoE herunterladen und starten
    Laden Sie Qwen3 30B-A3B herunter und chatten Sie sofort damit. Beim ersten Start wird das Modell heruntergeladen (rechnen Sie mit mehreren GB).
  2. 02
    Die Geschwindigkeit beobachten
    Stellen Sie eine etwas lange Frage und notieren Sie die Geschwindigkeit. Trotz seiner 30 Milliarden Parameter antwortet es sofort, mit der Geschwindigkeit eines kleinen Modells.
  3. 03
    Mit einem dichten Modell vergleichen
    Starten Sie ein dichtes Modell ähnlicher Größe und stellen Sie dieselbe Frage. Das MoE-Modell sollte bei vergleichbarem VRAM-Bedarf deutlich schneller generieren.
Terminal
# Lancer un MoE et discuter avec
ollama run qwen3:30b-a3b

# Pour comparer avec un dense de taille voisine
ollama run qwen3:32b
i
Den Durchsatz prüfen
Fügen Sie das Flag --verbose (ollama run qwen3:30b-a3b --verbose) hinzu, um am Ende der Antwort die Tokens pro Sekunde zu sehen und MoE-Modelle und dichte Modelle auf Ihrem Rechner objektiv zu vergleichen.

#Weiterführende Informationen

MoE lässt sich besser verstehen, wenn man es mit den anderen Grundlagen lokaler KI verknüpft. Diese Leitfäden knüpfen direkt an diesen an:

Quantisierung wählen (Q4, Q5, Q8, FP16)
MoE reagiert empfindlich auf eine zu aggressive Quantisierung: Dieser Leitfaden hilft, den richtigen Kompromiss zwischen Qualität und Speicherbedarf zu finden.
Ollama installieren: Windows, macOS und Linux
Um den lokalen Daemon auf Port 11434 einzurichten, bevor Sie Ihr erstes MoE-Modell herunterladen.
Llama 4 Scout lokal: Installation und erste Tests mit Ollama
Ein multimodales MoE-Modell, Schritt für Schritt erklärt, um die Theorie dieses Leitfadens in der Praxis zu sehen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.