Fortgeschritten 9 Min.LM Studio

MTP in LM Studio: Multi-Token aktivieren Prediction

MTP (Multi-Token Prediction) ist eine der wenigen Inferenztechniken, die in LM Studio einen echten Zuwachs an Tokens pro Sekunde ermöglicht, ohne die Qualität zu beeinträchtigen. Durch DeepSeek V3 bekannt geworden, hält die Technik nun auch Einzug in die von LM Studio verwendete llama.cpp-Laufzeitumgebung. Dieser Leitfaden erklärt, was MTP ist, bei welchen Modellen es funktioniert, wie es in LM Studio aktiviert wird und welcher Leistungsgewinn zu erwarten ist – ohne das Blaue vom Himmel zu versprechen.

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet
i
Kurz gesagt
MTP (Multi-Token Prediction) erzeugt mehrere Tokens pro Forward-Pass statt nur eines und erhöht dadurch den Durchsatz ohne schnellere Grafikkarte. · Nur bestimmte Modelle unterstützen MTP nativ: die DeepSeek-Modellreihe (V3, V3.1, V4 Flash) und bestimmte Qwen3-MoE-Varianten mit MTP-Heads im GGUF. · MTP lässt sich in LM Studio 0.3.10+ mit einer aktuellen llama.cpp-Laufzeit aktivieren, anschließend über einen Schalter in der „Advanced Configuration“ des Modells. · Gemessener Gewinn: DeepSeek V3 32B Q4 steigt auf einer RTX 4090 bei Code von etwa 25 auf 42 tok/s.

#Warum MTP die Inferenz beschleunigt

Die Inferenz eines LLM wird durch den Speicher begrenzt: Bei jedem generierten Token müssen sämtliche Modellgewichte erneut aus dem VRAM gelesen werden. Bei einem 32B-Modell in Q4 werden pro Schritt ~19 GB übertragen. Selbst eine RTX 4090 erreicht höchstens rund 1 TB/s Speicherbandbreite, wodurch der Durchsatz zwangsläufig auf einige Dutzend Tokens pro Sekunde begrenzt ist.

MTP umgeht diese Grenze auf einfache Weise: Es werden mehrere Tokens pro Forward-Pass generiert statt nur eines. Wenn sich mit einem einzigen Hin- und Rücktransfer zum Speicher 2 oder 3 gültige Tokens erzeugen lassen, steigt der Durchsatz entsprechend – ohne eine schnellere Karte kaufen zu müssen. Das unterscheidet MTP von anderen „Optimierungen“, die lediglich die Rechenleistung besser nutzen (Flash Attention, Prefix Caching): Hier wird direkt am dominierenden Engpass angesetzt.

i
Worum es geht, in einem Satz
MTP sorgt weder dafür, dass das Modell schneller lädt, noch macht es das Modell kleiner oder besser. Es erledigt lediglich mehr nützliche Arbeit pro Zugriff auf den VRAM. Bei einem lokal betriebenen 32B-Modell macht das den Unterschied zwischen 25 und 45 tok/s aus. Das ist enorm.

#Was MTP wirklich macht

Das Kit Lokale KI

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Konkret hat ein mit MTP trainiertes Modell nicht nur einen einzigen Vorhersagekopf. Es hat zwei, drei oder vier hintereinandergeschaltete Köpfe: Der erste sagt das Token N+1 voraus, der zweite versucht, das Token N+2 vorherzusagen, usw. Während des Trainings lernen diese Hilfsköpfe, anhand der verborgenen Zwischenzustände die folgenden Tokens vorwegzunehmen. Nach dem Training kann das Modell diese Köpfe bei der Inferenz nutzen, um mehrere Kandidaten auf einmal zu erzeugen.

Bei der Generierung kommen in den aktuellen Laufzeitumgebungen zwei Verfahren nebeneinander zum Einsatz:

MTP beim spekulativen Decoding
Die Hilfs-Heads erzeugen einen Entwurf aus 2 bis 4 Tokens. Anschließend prüft das Hauptmodell in einem einzigen Forward-Pass, ob es diese akzeptiert. Jedes abgelehnte Token wird neu generiert. Dies ist die Standardimplementierung in llama.cpp für DeepSeek V3.
MTP als internes Draft-Modell
Eine Variante, bei der die sekundären Heads ausschließlich als kleines Entwurfsmodell dienen und die Laufzeitumgebung dieses wie ein gewöhnliches Draft-Modell behandelt, das jedoch in derselben GGUF-Datei enthalten ist. Einfacher bereitzustellen, aber mit einem geringeren Gewinn.
→
Keine Magie, aber leistungsstark
Die Akzeptanzrate der vorgeschlagenen Tokens ist der entscheidende Faktor. Bei strukturiertem Text (Code, JSON, Markierungen) liegt sie über 80 % und der Gewinn nähert sich 2× an. Bei sehr kreativem oder sehr unvorhersehbarem Text kann sie gelegentlich unter 50 % sinken und der Gewinn reduziert sich auf 1,2 bis 1,3×.

#Welche Modelle MTP tatsächlich unterstützen

MTP ist keine Einstellung, die sich bei jedem beliebigen Modell einschalten lässt: Das Modell muss mit MTP-Köpfen trainiert worden sein, und die entsprechenden Gewichte müssen in der GGUF-Datei enthalten sein. Derzeit ist die Liste der für den lokalen Einsatz mit LM Studio geeigneten Modelle kurz:

DeepSeek V3 (Base und Chat)
Der Pionier. MoE-Architektur mit 671B und 4 MTP-Heads. Für den lokalen Einsatz kommen stark quantisierte Varianten (Q2_K_XL, IQ3_XS) oder destillierte Modelle infrage.
DeepSeek V3.1 / V3.2 / V4 Flash
Die gesamte DeepSeek-Modellfamilie hat MTP geerbt. Die Flash-Versionen (≈300 Milliarden Parameter, MoE) sind die einzigen, die tatsächlich auf einen Mac Studio Ultra oder ein Multi-GPU-System mit 80–100 GB VRAM passen.
Qwen3 MoE (Auswahl von Varianten)
Mehrere Qwen3-MoE-Varianten haben GGUF-Gewichte mit MTP-Köpfen veröffentlicht. Prüfen Sie die Modellseite auf Hugging Face: Ein Feld „mtp_layers“ oder das Suffix „-mtp“ im Namen ist ein guter Hinweis.
Klassische dichte Modelle (Gemma 4, Mistral Small, Qwen 3.5)
Keine native MTP-Unterstützung. LM Studio wird nichts Besonderes tun. Für diese Modelle ist die einzige verfügbare Entsprechung das klassische spekulative Decoding mit einem separaten Draft-Modell.
!
GGUF prüfen
Eine GGUF-Datei mit der Bezeichnung „DeepSeek“ enthält nicht unbedingt die MTP-Heads: Einige Community-Konvertierungen haben sie entfernt, um einige Hundert MB zu sparen. Suchen Sie in der Repository-Beschreibung nach der ausdrücklichen Angabe „MTP“ oder „multi-token“ oder prüfen Sie die Größe – ein Modell mit MTP ist bei gleicher Quantisierung 5–10 % größer.

#Voraussetzungen für LM Studio

Aktuelle Version von LM Studio
Version 0.3.10 oder höher. Ältere Versionen verwenden eine llama.cpp-Laufzeit aus der Zeit vor der MTP-Unterstützung, und die Option erscheint schlicht nicht in der Benutzeroberfläche.
Aktuelle llama.cpp-Runtime
Die MTP-Unterstützung wurde Ende 2024 in llama.cpp eingeführt und im Laufe des Jahres 2025 stabilisiert. LM Studio enthält mehrere Runtime-Versionen; Sie müssen im Tab Runtimes ausdrücklich die neueste auswählen.
Ausreichend VRAM oder Unified Memory
MTP verursacht nur einen geringen zusätzlichen Speicherbedarf (die Hilfsköpfe sind klein), aber das gesamte Modell muss dennoch geladen werden. Rechnen Sie mit dem üblichen VRAM-Bedarf für die angestrebte Modellgröße plus 5–10 % für den erweiterten KV-Cache, der während der Überprüfung verwendet wird.
GPU korrekt erkannt
Der Leistungsgewinn durch MTP zeigt sich nur, wenn die GPU die Inferenz begrenzt. Im reinen CPU-Betrieb gibt es zwar einen Nutzen, dieser ist jedoch meist nur gering und fällt bei kleinen Modellen manchmal sogar negativ aus.

#1. Die aktuelle Laufzeitumgebung aktivieren

Bevor Sie etwas am Modell ändern, prüfen Sie, ob LM Studio eine Version von llama.cpp verwendet, die MTP unterstützt. Dieser Schritt wird am häufigsten vergessen.

  1. 01
    Die Runtime-Einstellungen öffnen
    Klicken Sie in LM Studio auf das Zahnradsymbol (Settings) und öffnen Sie dann den Bereich „Runtimes“ (oder je nach Version „LM Runtimes“). Dort sehen Sie die installierten Runtimes: CUDA, Metal, Vulkan, CPU.
  2. 02
    Die neueste Version installieren
    Klicken Sie neben der Runtime Ihrer Plattform auf „Check for updates“. LM Studio lädt eine aktuelle Version des integrierten llama.cpp herunter. MTP-Unterstützung ist in allen Builds ab 2025 enthalten.
  3. 03
    Die aktive Version überprüfen
    Im selben Abschnitt wird die aktuell verwendete Version angezeigt (zum Beispiel „llama.cpp v0.3.x — CUDA“). Vergewissern Sie sich, dass sie nach November 2024 veröffentlicht wurde. Wenn mehrere Runtimes vorhanden sind, wählen Sie die neueste als Standard.
i
Die Laufzeitumgebung, nicht die App
LM Studio und seine Laufzeitumgebung llama.cpp entwickeln sich unabhängig voneinander weiter. Eine ältere Version von LM Studio kann durchaus mit einer aktuellen Laufzeitumgebung laufen: Für MTP ist die Version der integrierten Laufzeitumgebung entscheidend.

#2. Ein Modell mit MTP-Head laden

Laden Sie ein MTP-kompatibles Modell über den integrierten Suchtab herunter. Geben Sie „DeepSeek V3“ oder „Qwen3 MoE“ ein und filtern Sie nach neueren GGUF-Builds, die MTP erwähnen. Alternativ können Sie direkt Hugging Face nutzen und die GGUF-Datei in den Modellordner von LM Studio ziehen.

Pfad zum Modellverzeichnis von LM Studio
# Linux / macOS
~/.lmstudio/models/

# Windows
%USERPROFILE%\.lmstudio\models\

Sobald das Modell in der Bibliothek sichtbar ist, laden Sie es wie gewohnt über den Tab Chat oder den Tab Local Server. Bevor Sie auf „Load“ klicken, öffnen Sie den Bereich „Advanced Configuration“: Dort erscheinen die MTP-Optionen, wenn das Modell sie deklariert.

→
Der positive Hinweis
Wenn die Option MTP in der Advanced Configuration nicht angezeigt wird, liegt das fast immer daran, dass die MTP-Köpfe nicht im GGUF enthalten sind. Laden Sie eine andere Variante herunter, bevor Sie die Sache unnötig verkomplizieren.

#3. MTP-Parameter einstellen

Unter Advanced Configuration werden in der Regel drei Parameter für MTP angezeigt. Die Namen variieren je nach Version von LM Studio, aber das Prinzip bleibt gleich.

Enable MTP (oder Use MTP heads)
Hauptschalter. Aktivieren. Wenn deaktiviert, ignoriert das Modell seine zusätzlichen Heads und verhält sich wie ein klassisches Modell.
MTP draft tokens (n_draft)
Anzahl der pro Durchlauf vorgeschlagenen Tokens. Typischer Wert: 3 oder 4. Bei höheren Werten sinkt die Akzeptanzrate und der Geschwindigkeitsgewinn verfliegt. Bei niedrigeren Werten (1–2) wird der Überprüfungsaufwand mit dem Gewinn vergleichbar.
MTP acceptance threshold
Konfidenzschwelle für die Annahme eines vorgeschlagenen Tokens. Standardmäßig oft etwa 0,7. Höher = mehr Sicherheit, aber weniger Gewinn. Niedriger = schneller, aber die Ausgabequalität kann sich subtil verändern.
Beispiel für eine gespeicherte Konfiguration (model_config.json)
{
  "mtp": {
    "enabled": true,
    "n_draft": 3,
    "acceptance_threshold": 0.7
  },
  "gpu_layers": -1,
  "context_length": 8192
}
!
Senken Sie den Schwellenwert nicht, ohne ihn zu testen
Das Senken von acceptance_threshold auf 0,5 erhöht die Zahl der Tokens pro Sekunde um 10–15 %, führt aber bei langen Generierungen zu kleinen stilistischen Abweichungen. Vergleichen Sie Ihre Ausgaben nebeneinander, bevor Sie diese Einstellung endgültig festlegen.

#4. Den tatsächlichen Gewinn auf Ihrem Gerät messen

Die Aktivierung des MTP ohne Messung bedeutet, die Hälfte des Nutzens des Leitfadens zu verpassen. LM Studio zeigt den Durchsatz am unteren Rand des Chats (tok/s) nach jeder Generierung an. Die ehrliche Methode:

  1. 01
    3 repräsentative Prompts vorbereiten
    Ein Code-Prompt (sehr strukturiert, mit einer erwarteten hohen Akzeptanzrate), ein sachlicher Prompt auf Französisch, ein freier kreativer Prompt. Speichern Sie diese Prompts, damit Sie sie unverändert erneut ausführen können.
  2. 02
    MTP deaktivieren, Baseline messen
    Das Modell entladen, MTP deaktivieren, erneut laden. Jeden Prompt ausführen und den durchschnittlichen tok/s-Wert über 3 Wiederholungen notieren. Nicht vergessen, den allerersten Durchlauf zu ignorieren (Prefill nicht vergleichbar).
  3. 03
    MTP aktivieren, messen
    Das Modell entladen, MTP wieder aktivieren und mit genau denselben Parametern (Kontext, Temperatur usw.) erneut laden. Dieselben Prompts erneut ausführen.
  4. 04
    Vergleichen
    Das Verhältnis pro Prompt berechnen. Bei Code ist ein Faktor von 1,5–2× zu erwarten, bei sachlichen Texten auf Französisch 1,3–1,7× und bei kreativen Texten 1,1–1,4×. Liegt der Faktor überall unter 1,2×, stimmt etwas nicht (zu alte Laufzeitumgebung, fehlende MTP-Heads oder eine durch andere Aufgaben ausgelastete GPU).
DeepSeek V3, destilliert, 32B Q4, RTX 4090
Baseline ~25 tok/s, mit aktiviertem MTP ~42 tok/s bei einem Prompt mit Python-Code. Bei französischer Prosa ~30 tok/s.
DeepSeek V4 Flash auf Mac Studio M2 Ultra 192 GB
Baseline ~14 Tok/s, MTP aktiviert ~24 Tok/s bei Code. Bei freiem Text ~18 Tok/s. Der Vorteil ist auch bei Apple Silicon deutlich spürbar.
Qwen3 MoE 30B-A3B Q4, RTX 4070 Ti
Ausgangswert: ~38 tok/s, mit aktiviertem MTP ~55 tok/s bei JSON. Bei kreativen Texten steigt die Geschwindigkeit nur auf ~46 tok/s.

#Erweiterte Einstellungen und Kombinationen

MTP lässt sich gut mit anderen Optimierungen kombinieren, die in LM Studio verfügbar sind. Einige Kombinationen, die funktionieren:

MTP + Flash Attention
Gleichzeitig aktivieren. Flash Attention reduziert den Speicherbedarf des KV-Caches bei der Überprüfung der Entwürfe, was bei einem hohen Wert für n_draft hilfreich ist.
MTP + Q4_K_M (im Vergleich zu Q8)
MTP erhält die Qualität selbst bei aggressiver Q4-Quantisierung. Es gibt keinen Grund, auf Q8 zu wechseln, um dies „auszugleichen“ — behalten Sie Q4_K_M bei und sparen Sie VRAM.
MTP + großer Kontext
Der KV-Cache benötigt mit MTP mehr Speicher (bei der Überprüfung werden mehr Zwischenzustände gespeichert). Rechnen Sie bei einem 32B-Modell mit 32k Kontext mit 1–2 GB zusätzlichem VRAM.
MTP + Batch (Local Server)
Wenn Sie mehrere Anfragen gleichzeitig über den OpenAI-kompatiblen Server von LM Studio verarbeiten, addieren sich der MTP-Vorteil und der Vorteil des Batching. Dort sehen Sie die größten Unterschiede.
→
Profil je nach Einsatzzweck
Für Unterstützung beim Programmieren (Continue.dev, Aider), die an LM Studio angebunden ist, setzen Sie n_draft auf 4: Code ist so vorhersehbar, dass die Akzeptanzrate hoch bleibt. Für allgemeine Chats bleiben Sie bei 3. Für fiktionale Texte oder Brainstorming senken Sie n_draft auf 2 oder deaktivieren Sie MTP sogar ganz.

#Fehlerbehebung

Die MTP-Option erscheint nicht
Entweder ist die Laufzeitumgebung zu alt (prüfen Sie die Version unter Settings → Runtimes), oder das GGUF-Modell enthält keine MTP-Heads. Laden Sie eine Variante herunter, die ausdrücklich als MTP gekennzeichnet ist.
MTP aktiviert, aber kein Gewinn gemessen
Stellen Sie sicher, dass die GPU tatsächlich als Ziel festgelegt ist (gpu_layers = -1 oder gleich der Gesamtzahl der Schichten). Bei reiner CPU-Verarbeitung kann MTP manchmal mehr kosten, als es bringt. Prüfen Sie auch, dass kein anderer Prozess den VRAM vollständig belegt.
Abdriftende Ausgabe oder merkwürdige Wiederholungen
Acceptance threshold ist zu niedrig. Erhöhen Sie den Wert auf 0,75–0,8. Falls das Problem weiterhin besteht, deaktivieren Sie MTP: Bei sehr atypischen Prompts gibt es pathologische Fälle.
LM Studio stürzt beim Laden ab
Eine fehlerhaft konvertierte GGUF-Datei mit beschädigten MTP-Heads kann die Laufzeitumgebung zum Absturz bringen. Versuchen Sie eine andere Quantisierung desselben Modells oder eine Datei eines anderen Herausgebers auf Hugging Face.
Sichtbarer Vorteil im Chat, aber nicht über die API
Prüfen Sie, ob der Local Server tatsächlich dieselbe Konfiguration wie der Chat verwendet – für den Server gibt es eine separate Einstellungsseite, auf der MTP unabhängig davon erneut aktiviert werden muss.
i
Wann MTP deaktiviert bleiben sollte
Bei einem individuell feinabgestimmten Modell, bei dem Sie vermuten, dass die Hilfsköpfe nicht richtig gelernt haben, bei einem kleinen Modell, das ausschließlich auf der CPU läuft, oder beim Debuggen, wenn Sie eine möglichst deterministische Ausgabe möchten: MTP zu deaktivieren ist eine vernünftige Entscheidung.

#Weiterführende Informationen

MTP ist eine der Möglichkeiten zur Leistungssteigerung, die beim lokalen Betrieb wirklich funktionieren. Einige ergänzende Ansätze, um noch mehr herauszuholen:

Erste Schritte mit LM Studio
Wenn Sie diese Seite lesen, ohne LM Studio bereits installiert zu haben, vermittelt der Einstiegsleitfaden die Grundlagen, bevor Sie sich mit den erweiterten Einstellungen befassen.
LM Studio in einen API-Server verwandeln
Um einen OpenAI-kompatiblen Endpunkt bereitzustellen und MTP in all Ihren Clients (Continue.dev, Aider, Python-Skripte) zu nutzen.
Plugins für LM Studio: Welche installieren und wie?
Über MTP hinaus eröffnen das Plugin-Ökosystem und das SDK lmstudio-js/python weitere Möglichkeiten.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.