MTP in LM Studio: Multi-Token aktivieren Prediction
MTP (Multi-Token Prediction) ist eine der wenigen Inferenztechniken, die in LM Studio einen echten Zuwachs an Tokens pro Sekunde ermöglicht, ohne die Qualität zu beeinträchtigen. Durch DeepSeek V3 bekannt geworden, hält die Technik nun auch Einzug in die von LM Studio verwendete llama.cpp-Laufzeitumgebung. Dieser Leitfaden erklärt, was MTP ist, bei welchen Modellen es funktioniert, wie es in LM Studio aktiviert wird und welcher Leistungsgewinn zu erwarten ist – ohne das Blaue vom Himmel zu versprechen.
#Warum MTP die Inferenz beschleunigt
Die Inferenz eines LLM wird durch den Speicher begrenzt: Bei jedem generierten Token müssen sämtliche Modellgewichte erneut aus dem VRAM gelesen werden. Bei einem 32B-Modell in Q4 werden pro Schritt ~19 GB übertragen. Selbst eine RTX 4090 erreicht höchstens rund 1 TB/s Speicherbandbreite, wodurch der Durchsatz zwangsläufig auf einige Dutzend Tokens pro Sekunde begrenzt ist.
MTP umgeht diese Grenze auf einfache Weise: Es werden mehrere Tokens pro Forward-Pass generiert statt nur eines. Wenn sich mit einem einzigen Hin- und Rücktransfer zum Speicher 2 oder 3 gültige Tokens erzeugen lassen, steigt der Durchsatz entsprechend – ohne eine schnellere Karte kaufen zu müssen. Das unterscheidet MTP von anderen „Optimierungen“, die lediglich die Rechenleistung besser nutzen (Flash Attention, Prefix Caching): Hier wird direkt am dominierenden Engpass angesetzt.
#Was MTP wirklich macht
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
Konkret hat ein mit MTP trainiertes Modell nicht nur einen einzigen Vorhersagekopf. Es hat zwei, drei oder vier hintereinandergeschaltete Köpfe: Der erste sagt das Token N+1 voraus, der zweite versucht, das Token N+2 vorherzusagen, usw. Während des Trainings lernen diese Hilfsköpfe, anhand der verborgenen Zwischenzustände die folgenden Tokens vorwegzunehmen. Nach dem Training kann das Modell diese Köpfe bei der Inferenz nutzen, um mehrere Kandidaten auf einmal zu erzeugen.
Bei der Generierung kommen in den aktuellen Laufzeitumgebungen zwei Verfahren nebeneinander zum Einsatz:
- MTP beim spekulativen Decoding
- Die Hilfs-Heads erzeugen einen Entwurf aus 2 bis 4 Tokens. Anschließend prüft das Hauptmodell in einem einzigen Forward-Pass, ob es diese akzeptiert. Jedes abgelehnte Token wird neu generiert. Dies ist die Standardimplementierung in llama.cpp für DeepSeek V3.
- MTP als internes Draft-Modell
- Eine Variante, bei der die sekundären Heads ausschließlich als kleines Entwurfsmodell dienen und die Laufzeitumgebung dieses wie ein gewöhnliches Draft-Modell behandelt, das jedoch in derselben GGUF-Datei enthalten ist. Einfacher bereitzustellen, aber mit einem geringeren Gewinn.
#Welche Modelle MTP tatsächlich unterstützen
MTP ist keine Einstellung, die sich bei jedem beliebigen Modell einschalten lässt: Das Modell muss mit MTP-Köpfen trainiert worden sein, und die entsprechenden Gewichte müssen in der GGUF-Datei enthalten sein. Derzeit ist die Liste der für den lokalen Einsatz mit LM Studio geeigneten Modelle kurz:
- DeepSeek V3 (Base und Chat)
- Der Pionier. MoE-Architektur mit 671B und 4 MTP-Heads. Für den lokalen Einsatz kommen stark quantisierte Varianten (Q2_K_XL, IQ3_XS) oder destillierte Modelle infrage.
- DeepSeek V3.1 / V3.2 / V4 Flash
- Die gesamte DeepSeek-Modellfamilie hat MTP geerbt. Die Flash-Versionen (≈300 Milliarden Parameter, MoE) sind die einzigen, die tatsächlich auf einen Mac Studio Ultra oder ein Multi-GPU-System mit 80–100 GB VRAM passen.
- Qwen3 MoE (Auswahl von Varianten)
- Mehrere Qwen3-MoE-Varianten haben GGUF-Gewichte mit MTP-Köpfen veröffentlicht. Prüfen Sie die Modellseite auf Hugging Face: Ein Feld „mtp_layers“ oder das Suffix „-mtp“ im Namen ist ein guter Hinweis.
- Klassische dichte Modelle (Gemma 4, Mistral Small, Qwen 3.5)
- Keine native MTP-Unterstützung. LM Studio wird nichts Besonderes tun. Für diese Modelle ist die einzige verfügbare Entsprechung das klassische spekulative Decoding mit einem separaten Draft-Modell.
#Voraussetzungen für LM Studio
- Aktuelle Version von LM Studio
- Version 0.3.10 oder höher. Ältere Versionen verwenden eine llama.cpp-Laufzeit aus der Zeit vor der MTP-Unterstützung, und die Option erscheint schlicht nicht in der Benutzeroberfläche.
- Aktuelle llama.cpp-Runtime
- Die MTP-Unterstützung wurde Ende 2024 in llama.cpp eingeführt und im Laufe des Jahres 2025 stabilisiert. LM Studio enthält mehrere Runtime-Versionen; Sie müssen im Tab Runtimes ausdrücklich die neueste auswählen.
- Ausreichend VRAM oder Unified Memory
- MTP verursacht nur einen geringen zusätzlichen Speicherbedarf (die Hilfsköpfe sind klein), aber das gesamte Modell muss dennoch geladen werden. Rechnen Sie mit dem üblichen VRAM-Bedarf für die angestrebte Modellgröße plus 5–10 % für den erweiterten KV-Cache, der während der Überprüfung verwendet wird.
- GPU korrekt erkannt
- Der Leistungsgewinn durch MTP zeigt sich nur, wenn die GPU die Inferenz begrenzt. Im reinen CPU-Betrieb gibt es zwar einen Nutzen, dieser ist jedoch meist nur gering und fällt bei kleinen Modellen manchmal sogar negativ aus.
#1. Die aktuelle Laufzeitumgebung aktivieren
Bevor Sie etwas am Modell ändern, prüfen Sie, ob LM Studio eine Version von llama.cpp verwendet, die MTP unterstützt. Dieser Schritt wird am häufigsten vergessen.
- 01Die Runtime-Einstellungen öffnenKlicken Sie in LM Studio auf das Zahnradsymbol (Settings) und öffnen Sie dann den Bereich „Runtimes“ (oder je nach Version „LM Runtimes“). Dort sehen Sie die installierten Runtimes: CUDA, Metal, Vulkan, CPU.
- 02Die neueste Version installierenKlicken Sie neben der Runtime Ihrer Plattform auf „Check for updates“. LM Studio lädt eine aktuelle Version des integrierten llama.cpp herunter. MTP-Unterstützung ist in allen Builds ab 2025 enthalten.
- 03Die aktive Version überprüfenIm selben Abschnitt wird die aktuell verwendete Version angezeigt (zum Beispiel „llama.cpp v0.3.x — CUDA“). Vergewissern Sie sich, dass sie nach November 2024 veröffentlicht wurde. Wenn mehrere Runtimes vorhanden sind, wählen Sie die neueste als Standard.
#2. Ein Modell mit MTP-Head laden
Laden Sie ein MTP-kompatibles Modell über den integrierten Suchtab herunter. Geben Sie „DeepSeek V3“ oder „Qwen3 MoE“ ein und filtern Sie nach neueren GGUF-Builds, die MTP erwähnen. Alternativ können Sie direkt Hugging Face nutzen und die GGUF-Datei in den Modellordner von LM Studio ziehen.
Sobald das Modell in der Bibliothek sichtbar ist, laden Sie es wie gewohnt über den Tab Chat oder den Tab Local Server. Bevor Sie auf „Load“ klicken, öffnen Sie den Bereich „Advanced Configuration“: Dort erscheinen die MTP-Optionen, wenn das Modell sie deklariert.
#3. MTP-Parameter einstellen
Unter Advanced Configuration werden in der Regel drei Parameter für MTP angezeigt. Die Namen variieren je nach Version von LM Studio, aber das Prinzip bleibt gleich.
- Enable MTP (oder Use MTP heads)
- Hauptschalter. Aktivieren. Wenn deaktiviert, ignoriert das Modell seine zusätzlichen Heads und verhält sich wie ein klassisches Modell.
- MTP draft tokens (n_draft)
- Anzahl der pro Durchlauf vorgeschlagenen Tokens. Typischer Wert: 3 oder 4. Bei höheren Werten sinkt die Akzeptanzrate und der Geschwindigkeitsgewinn verfliegt. Bei niedrigeren Werten (1–2) wird der Überprüfungsaufwand mit dem Gewinn vergleichbar.
- MTP acceptance threshold
- Konfidenzschwelle für die Annahme eines vorgeschlagenen Tokens. Standardmäßig oft etwa 0,7. Höher = mehr Sicherheit, aber weniger Gewinn. Niedriger = schneller, aber die Ausgabequalität kann sich subtil verändern.
#4. Den tatsächlichen Gewinn auf Ihrem Gerät messen
Die Aktivierung des MTP ohne Messung bedeutet, die Hälfte des Nutzens des Leitfadens zu verpassen. LM Studio zeigt den Durchsatz am unteren Rand des Chats (tok/s) nach jeder Generierung an. Die ehrliche Methode:
- 013 repräsentative Prompts vorbereitenEin Code-Prompt (sehr strukturiert, mit einer erwarteten hohen Akzeptanzrate), ein sachlicher Prompt auf Französisch, ein freier kreativer Prompt. Speichern Sie diese Prompts, damit Sie sie unverändert erneut ausführen können.
- 02MTP deaktivieren, Baseline messenDas Modell entladen, MTP deaktivieren, erneut laden. Jeden Prompt ausführen und den durchschnittlichen tok/s-Wert über 3 Wiederholungen notieren. Nicht vergessen, den allerersten Durchlauf zu ignorieren (Prefill nicht vergleichbar).
- 03MTP aktivieren, messenDas Modell entladen, MTP wieder aktivieren und mit genau denselben Parametern (Kontext, Temperatur usw.) erneut laden. Dieselben Prompts erneut ausführen.
- 04VergleichenDas Verhältnis pro Prompt berechnen. Bei Code ist ein Faktor von 1,5–2× zu erwarten, bei sachlichen Texten auf Französisch 1,3–1,7× und bei kreativen Texten 1,1–1,4×. Liegt der Faktor überall unter 1,2×, stimmt etwas nicht (zu alte Laufzeitumgebung, fehlende MTP-Heads oder eine durch andere Aufgaben ausgelastete GPU).
- DeepSeek V3, destilliert, 32B Q4, RTX 4090
- Baseline ~25 tok/s, mit aktiviertem MTP ~42 tok/s bei einem Prompt mit Python-Code. Bei französischer Prosa ~30 tok/s.
- DeepSeek V4 Flash auf Mac Studio M2 Ultra 192 GB
- Baseline ~14 Tok/s, MTP aktiviert ~24 Tok/s bei Code. Bei freiem Text ~18 Tok/s. Der Vorteil ist auch bei Apple Silicon deutlich spürbar.
- Qwen3 MoE 30B-A3B Q4, RTX 4070 Ti
- Ausgangswert: ~38 tok/s, mit aktiviertem MTP ~55 tok/s bei JSON. Bei kreativen Texten steigt die Geschwindigkeit nur auf ~46 tok/s.
#Erweiterte Einstellungen und Kombinationen
MTP lässt sich gut mit anderen Optimierungen kombinieren, die in LM Studio verfügbar sind. Einige Kombinationen, die funktionieren:
- MTP + Flash Attention
- Gleichzeitig aktivieren. Flash Attention reduziert den Speicherbedarf des KV-Caches bei der Überprüfung der Entwürfe, was bei einem hohen Wert für n_draft hilfreich ist.
- MTP + Q4_K_M (im Vergleich zu Q8)
- MTP erhält die Qualität selbst bei aggressiver Q4-Quantisierung. Es gibt keinen Grund, auf Q8 zu wechseln, um dies „auszugleichen“ — behalten Sie Q4_K_M bei und sparen Sie VRAM.
- MTP + großer Kontext
- Der KV-Cache benötigt mit MTP mehr Speicher (bei der Überprüfung werden mehr Zwischenzustände gespeichert). Rechnen Sie bei einem 32B-Modell mit 32k Kontext mit 1–2 GB zusätzlichem VRAM.
- MTP + Batch (Local Server)
- Wenn Sie mehrere Anfragen gleichzeitig über den OpenAI-kompatiblen Server von LM Studio verarbeiten, addieren sich der MTP-Vorteil und der Vorteil des Batching. Dort sehen Sie die größten Unterschiede.
#Fehlerbehebung
- Die MTP-Option erscheint nicht
- Entweder ist die Laufzeitumgebung zu alt (prüfen Sie die Version unter Settings → Runtimes), oder das GGUF-Modell enthält keine MTP-Heads. Laden Sie eine Variante herunter, die ausdrücklich als MTP gekennzeichnet ist.
- MTP aktiviert, aber kein Gewinn gemessen
- Stellen Sie sicher, dass die GPU tatsächlich als Ziel festgelegt ist (gpu_layers = -1 oder gleich der Gesamtzahl der Schichten). Bei reiner CPU-Verarbeitung kann MTP manchmal mehr kosten, als es bringt. Prüfen Sie auch, dass kein anderer Prozess den VRAM vollständig belegt.
- Abdriftende Ausgabe oder merkwürdige Wiederholungen
- Acceptance threshold ist zu niedrig. Erhöhen Sie den Wert auf 0,75–0,8. Falls das Problem weiterhin besteht, deaktivieren Sie MTP: Bei sehr atypischen Prompts gibt es pathologische Fälle.
- LM Studio stürzt beim Laden ab
- Eine fehlerhaft konvertierte GGUF-Datei mit beschädigten MTP-Heads kann die Laufzeitumgebung zum Absturz bringen. Versuchen Sie eine andere Quantisierung desselben Modells oder eine Datei eines anderen Herausgebers auf Hugging Face.
- Sichtbarer Vorteil im Chat, aber nicht über die API
- Prüfen Sie, ob der Local Server tatsächlich dieselbe Konfiguration wie der Chat verwendet – für den Server gibt es eine separate Einstellungsseite, auf der MTP unabhängig davon erneut aktiviert werden muss.
#Weiterführende Informationen
MTP ist eine der Möglichkeiten zur Leistungssteigerung, die beim lokalen Betrieb wirklich funktionieren. Einige ergänzende Ansätze, um noch mehr herauszuholen:
- Erste Schritte mit LM Studio
- Wenn Sie diese Seite lesen, ohne LM Studio bereits installiert zu haben, vermittelt der Einstiegsleitfaden die Grundlagen, bevor Sie sich mit den erweiterten Einstellungen befassen.
- LM Studio in einen API-Server verwandeln
- Um einen OpenAI-kompatiblen Endpunkt bereitzustellen und MTP in all Ihren Clients (Continue.dev, Aider, Python-Skripte) zu nutzen.
- Plugins für LM Studio: Welche installieren und wie?
- Über MTP hinaus eröffnen das Plugin-Ökosystem und das SDK lmstudio-js/python weitere Möglichkeiten.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.