Einsteiger 12 Min.Oberflächen

LM Studio: vollständiges Tutorial 2026 (Installation, API)

LM Studio ist eine Desktop-Anwendung, die Ihre Maschine in einen lokalen LLM-Server verwandelt, ohne den Terminalzugriff zu berühren. Die Version 0.3+ bietet Unterstützung für MCP, einen verbesserten GGUF-Engine und eine direkte Modellherunterladefunktion über Hugging Face. Hier finden Sie ein umfassendes Tutorial LM Studio 2026: Installation auf den drei Betriebssystemen, Erste Schritte mit einem Modell, Einrichtung eines OpenAI-kompatiblen Servers auf Port 1234 und eine ehrliche Vergleich mit Ollama und Jan.

Von Mohamed Meguedmi·Aktualisierung 2026-09-12·Getestet auf Windows 11

#Erstes Ergebnis: Herunterladen, Laden, Überprüfen

Die offizielle Dokumentation beschreibt den Ablauf Discover → Herunterladen → Chat → Laden des Modells. Wählen Sie die Datei für Ihre Engine: GGUF für llama.cpp oder eine kompatible MLX-Distribution auf Apple Silicon. Ein heruntergeladenes Modell ist noch nicht geladen. Beginnen Sie mit einem kurzen Kontext und stellen Sie dann eine einfache Frage, bevor Sie Dokumente oder einen API-Server hinzufügen.

Falls die Speicherressourcen nicht ausreichen, verringern Sie den Kontext und wählen Sie eine kleinere Datei; steuern Sie den GPU-Offload. Der Modell- und Kontextverbrauch teilt sich den Budget mit dem System auf Apple Silicon. Die Windows/macOS-Anweisungen wurden in der Dokumentation überprüft; der Ordner vom 12. September wurde unter Linux mit Ollama ausgeführt, nicht mit LM Studio.

Installierte Modelle prüfen und den Ladevorgang abschätzen
lms ls
# Remplacer MODEL_KEY par une clé réellement affichée :
lms load MODEL_KEY --context-length 4096 --estimate-only

#Warum LM Studio im Jahr 2026

Das Kit Lokale KI

LM Studio ist installiert und Ihr erstes Modell antwortet. Die nächsten Schritte finden Sie im Kit für lokale KI: das zu Ihrem Rechner passende Modell auswählen (Kap. 3), die Möglichkeiten von LM Studio weiter ausschöpfen (Kap. 5) und es anschließend Ihre eigenen Dokumente lesen lassen (Kap. 8).

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

LM Studio besetzt eine klar umrissene Nische: Nutzer, die eine richtige grafische Anwendung statt eines CLI-Daemons möchten. Sie öffnen die App, suchen in der integrierten Suchleiste (die auf Hugging Face zugreift) nach einem Modell, klicken auf Download und chatten. Keine Konfigurationsdatei, keine Kommandozeile.

Unter der Haube enthält LM Studio llama.cpp mit Unterstützung für CUDA, Metal, Vulkan und ROCm sowie eine speziell für Macs mit Apple Silicon vorgesehene MLX-Engine. Version 0.3 führte die Ansicht „Power User“ ein, die alle Parameter zugänglich macht (KV-Cache-Typ, Flash Attention, GPU-Offloading Schicht für Schicht), und Version 0.3.x ergänzte die native Unterstützung für MCP-Server – Sie verbinden Ihr lokales Modell mit Tools wie einem Dateisystem oder einer Datenbank, ohne zu programmieren.

i
Lizenz und kommerzieller Gebrauch
LM Studio ist für den persönlichen Gebrauch kostenlos. Für den kommerziellen Einsatz in Unternehmen lässt sich das Formular „LM Studio at Work“ seit Version 0.3.5 nun selbstständig ausfüllen – kostenlos, aber verpflichtend. Standardmäßig werden keine Modell-Telemetriedaten gesendet.

#Voraussetzungen

Windows
Windows 10/11, 64 Bit. AVX2 erforderlich (alle CPUs seit 2014). CUDA-Unterstützung bei NVIDIA-GPUs, andernfalls Vulkan.
macOS
macOS 13.4+ auf Apple Silicon (M1/M2/M3/M4). Macs mit Intel-Prozessoren werden seit Version 0.3 nicht mehr unterstützt.
Linux
AppImage x86_64, glibc 2.35+ (Ubuntu 22.04, Fedora 36, Arch aktuell). ARM64-Build für SBC verfügbar.
RAM
16 GB sind das Minimum für eine komfortable Nutzung, 8 GB sind knapp. Planen Sie für ein 14B-Modell in Q4 12 GB freien RAM ein; für ein 32B-Modell 24 GB.
Festplatte
Rechnen Sie mit 30 bis 50 GB: Ein Modell mit 14 Milliarden Parametern in Q4 benötigt etwa 9 GB, und Sie werden mehrere herunterladen.

#1. Installation unter Windows, Mac und Linux

Laden Sie das Installationsprogramm für Ihr Betriebssystem von der offiziellen Website herunter. Kein npm-Paket, kein Homebrew – es handelt sich um eine klassische Desktop-Anwendung.

Offizielle Website
https://lmstudio.ai/download
  1. 01
    Windows
    Starten Sie LM-Studio-Setup.exe. SmartScreen kann die Binärdatei beim ersten Start blockieren — klicken Sie auf „Weitere Informationen“ und dann auf „Dennoch ausführen“. Die Anwendung wird unter %LOCALAPPDATA%\Programs\lm-studio installiert.
  2. 02
    macOS
    Öffnen Sie die .dmg-Datei und ziehen Sie LM Studio.app in /Applications. Beim ersten Start kann Gatekeeper Sie auffordern, die App unter Réglages → Confidentialité et sécurité zuzulassen. Auf Apple Silicon ist die MLX-Engine standardmäßig aktiviert.
  3. 03
    Linux
    Laden Sie die AppImage herunter, machen Sie sie mit chmod +x LM_Studio-0.3.x.AppImage ausführbar und starten Sie sie anschließend. Um sie in das Menü zu integrieren, verwenden Sie AppImageLauncher oder erstellen Sie manuell eine .desktop-Datei.
Linux — erster Start
chmod +x LM_Studio-0.3.x.AppImage
./LM_Studio-0.3.x.AppImage
→
Onboarding 2026
Beim ersten Start bietet Ihnen LM Studio 0.3+ die Modi „User“, „Power User“ und „Developer“ zur Auswahl an. Der Modus „Power User“ ermöglicht detaillierte Einstellungen (GPU layers, KV cache, flash attention); der Modus „Developer“ fügt die Registerkarte „Local Server“ hinzu. Beginnen Sie mit „Power User“ — zu „Developer“ wechseln Sie, sobald Sie die Server-API benötigen.

#2. Qwen3-Coder im GGUF-Format herunterladen

Die Registerkarte Discover (Lupe) ist Ihr Zugang zu Hugging Face. Geben Sie den Namen eines Modells ein, wählen Sie eine Quantisierung und klicken Sie auf Download. Für dieses Tutorial verwenden wir Qwen3-Coder-30B-A3B, das Open-Weight-Coding-Modell, das für Nutzer mit mindestens 16 GB VRAM als Referenz gilt.

  1. 01
    Das Modell suchen
    Geben Sie in Discover "qwen3-coder" ein. LM Studio zeigt die kompatiblen GGUF-Repositories an (in der Regel bartowski, unsloth, lmstudio-community). Bevorzugen Sie die Repositories lmstudio-community oder bartowski: Deren GGUF-Dateien sind für die aktuelle Version der Engine validiert.
  2. 02
    Die Quantisierung wählen
    Bei 24 GB VRAM bietet Q4_K_M das beste Verhältnis (Qualität ~99 % von FP16, Größe ~17 GB). Bei 16 GB gehen Sie auf Q3_K_M herunter. Bei 32 GB oder einem Mac Studio wählen Sie Q5_K_M oder Q8_0, wenn Ihnen maximale Genauigkeit wichtig ist.
  3. 03
    Download starten
    Klicken Sie auf Download. Der Fortschritt wird im Tab Downloads angezeigt. Bei einem Glasfaseranschluss sollten Sie für eine 17 GB große Datei etwa 5 Minuten einplanen.
  4. 04
    Modell laden
    Wechseln Sie zum Tab Chat, öffnen Sie oben das Auswahlmenü und wählen Sie Qwen3-Coder. Wenn Sie den Modus Power User verwenden, passen Sie GPU Offload (standardmäßig wählt LM Studio den höchsten sicheren Wert) und Context Length (32k sind für Code komfortabel) an und aktivieren Sie Flash Attention.
→
VRAM je nach Größe (Q4_K_M)
Schnelle Richtwerte: 3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Wenn LM Studio sich weigert, das Modell vollständig auf die GPU zu laden, wechselt es zu einer teilweisen Auslagerung auf die CPU – das ist praktikabel, aber 5 bis 10× langsamer.

#3. Erster Chat und GPU-Prüfung

Sobald das Modell geladen ist, stellen Sie eine Frage im Chat. LM Studio zeigt unten bei jeder Antwort die Tokens pro Sekunde, die Zeit bis zum ersten Token und den tatsächlichen VRAM-Verbrauch an. Das ist klarer als das parallele Ausführen von nvidia-smi.

Schnelltest
# Dans le chat LM Studio :
Écris une fonction Python qui parse un CSV streaming
sans charger tout le fichier en mémoire.

Auf einer RTX 4090 erreicht Qwen3-Coder-30B-A3B in Q4 dank seiner MoE-Architektur etwa 90–120 Tok/s (3B aktive Parameter von insgesamt 30B). Auf einem M4 Pro mit 48 GB können Sie mit der MLX-Engine mit 35–50 Tok/s rechnen. Auf einer RTX 3060 mit 12 GB passt das 30B-Modell nicht in den Speicher – wechseln Sie zu Qwen 3.5 9B (~6,6 GB in Q4), das problemlos hineinpasst und noch Spielraum für den Kontext lässt.

i
Modus „Just Show Me The Answer“
Standardmäßig zeigen Reasoning-Modelle ihre Gedankenkette in einem einklappbaren Bereich an. Unter „Settings“ eines Chats können Sie die Anzeige des Thinking deaktivieren, um nur die endgültige Antwort zu sehen. Hinweis: Qwen 3.8 27B neigt mit seiner Standardeinstellung für das Reasoning dazu, zu lange nachzudenken — stellen Sie den Reasoning-Aufwand auf „low“, wenn sich die Antworten unnötig hinziehen.

#4. OpenAI-kompatibler Server auf dem Port 1234

Das ist der Vorteil, den viele nicht kennen: LM Studio stellt einen HTTP-Server bereit, der mit der OpenAI-API kompatibel ist, standardmäßig unter http://localhost:1234. Sie können daher jeden OpenAI-Client (Python-SDK, LangChain, Continue.dev, Cursor, Ihre selbst entwickelte App) an LM Studio anbinden, ohne eine einzige Zeile der Geschäftslogik zu ändern — nur die Basis-URL und den Schlüssel müssen Sie ändern.

  1. 01
    Developer Mode aktivieren
    Ändern Sie unten links die Benutzerrolle auf „Developer“. Die Registerkarte Local Server (Terminal-Symbol) erscheint in der linken Seitenleiste.
  2. 02
    Server starten
    Registerkarte Local Server → wählen Sie im oberen Menü das Modell aus, das Sie bereitstellen möchten → klicken Sie auf Start Server. Standardmäßig lauscht der Server auf localhost:1234. Aktivieren Sie "Serve on Local Network", wenn Sie ihn für andere Rechner in Ihrem LAN zugänglich machen möchten.
  3. 03
    Den Endpunkt prüfen
    Der Server bietet die Endpunkte /v1/models, /v1/chat/completions, /v1/completions, /v1/embeddings (wenn ein Embedding-Modell geladen ist) an. Testen Sie zunächst die Liste der Modelle.
API-Test
curl http://localhost:1234/v1/models

curl http://localhost:1234/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-coder-30b-a3b",
    "messages": [{"role": "user", "content": "Bonjour"}],
    "stream": false
  }'
Offizieller Python-Client
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:1234/v1",
    api_key="lm-studio",  # ignorée, n'importe quelle chaîne
)

resp = client.chat.completions.create(
    model="qwen3-coder-30b-a3b",
    messages=[{"role": "user", "content": "Refactore ce code en idiomatic Rust : ..."}],
)
print(resp.choices[0].message.content)
→
JIT model loading
Aktivieren Sie „Just-in-Time Model Loading“ in den Servereinstellungen. LM Studio lädt dann automatisch das in der API-Anfrage angeforderte Modell – praktisch, wenn Sie von verschiedenen Clients aus zwischen mehreren Modellen wechseln.

#5. Native Unterstützung von MCP

Seit Version 0.3.17 unterstützt LM Studio das Model Context Protocol (MCP) – den von Anthropic 2024 eingeführten Standard zur Anbindung externer Tools an ein LLM. Konkret: Ihr lokales Modell kann auf Ihr Dateisystem zugreifen, SQL ausführen und eine API aufrufen, sofern ein MCP-Server konfiguriert ist.

Die Konfiguration erfolgt in der Datei mcp.json, die über das Menü Program → Edit mcp.json erreichbar ist. Hier ist ein Beispiel, das den offiziellen filesystem-Server von Anthropic und einen SQLite-Server hinzufügt.

mcp.json
{
  "mcpServers": {
    "filesystem": {
      "command": "npx",
      "args": [
        "-y",
        "@modelcontextprotocol/server-filesystem",
        "/home/user/Documents"
      ]
    },
    "sqlite": {
      "command": "uvx",
      "args": ["mcp-server-sqlite", "--db-path", "/home/user/data.db"]
    }
  }
}

Nach der Registrierung erscheinen die MCP-Tools unter dem Steckersymbol (Plug) im Chat. Sie können sie bei Bedarf aktivieren. Das Modell entscheidet anschließend, wann es sie aufruft: Das ist nützlich, um ohne Programmierung einen lokalen Mini-Agenten zu erstellen, etwa für „Fasse alle PDFs im Ordner Recherche zusammen“ oder „Wie viele Zeilen enthält die Tabelle users?“.

!
Welches Modell für Tool-Use?
Nicht alle Modelle sind gut im Tool-Calling. Qwen3-Coder 30B-A3B, GLM 4.7 Flash (hervorragend beim Einsatz als Agent), Devstral 24B und Mistral Small 24B funktionieren gut, ebenso wie jedes Modell, das ausdrücklich für Function-Calling trainiert wurde. Kleine Modelle (< 7B) halluzinieren häufig Tool-Namen – testen Sie sie vor der Bereitstellung.

#LM Studio vs Ollama vs Jan

Die drei Tools verfolgen dasselbe Ziel (LLM lokal ohne Cloud), setzen dabei aber auf unterschiedliche Ansätze.

LM Studio
Funktionsreiche Desktop-App, integrierte HF-Suche, API-Server auf Port :1234, MCP-Unterstützung, MLX auf dem Mac. Closed Source, aber kostenlos. Ideal, wenn Sie alles in einer Anwendung mit einer ausgereiften grafischen Oberfläche möchten.
Ollama
Leichter Daemon + CLI, lauscht auf :11434, riesige Bibliothek vorkonfigurierter Modelle (ollama run qwen3.5:9b), stabile API, zahlreiche Integrationen (Cline, Open WebUI, n8n). Open Source. Ideal, wenn Sie mit dem Terminal vertraut sind und einen Betrieb ohne grafische Oberfläche wünschen.
Jan
Open-Source-Desktop-App (AGPL) mit einer radikalen „Offline-first“-Philosophie, jünger und mit weniger Funktionen als LM Studio. Eine gute Wahl, wenn Ihnen Open Source wichtig ist und Sie eine Desktop-App möchten.
→
Erfolgreiche Kombination
Viele fortgeschrittene Nutzer betreiben Ollama als Server-Daemon (24/7, ohne GUI) und verwenden LM Studio als Client und zum Erkunden neuer Modelle, um diese zu testen, bevor sie sie in Ollama übernehmen. Beide können parallel laufen — sie lauschen auf unterschiedlichen Ports.

#Fehlerbehebung

Das Modell lädt nicht (OOM)
Reduzieren Sie GPU Offload manuell in den Settings des Chats. Wenn Sie das Modell zu 100 % auf die GPU auslagern und es dabei abstürzt, reduzieren Sie den Wert auf 80 % – einige Schichten werden dann in den Arbeitsspeicher verlagert. Das ist langsamer, aber das Modell läuft.
Sehr wenige Tokens pro Sekunde
Prüfen Sie, ob Flash Attention aktiviert ist und „KV cache type“ auf Q8_0 eingestellt ist (nicht auf FP16). Im Modus „Power User“ finden Sie diese Einstellungen in der rechten Seitenleiste des Chats.
Der API-Server antwortet nicht
Vergewissern Sie sich, dass Sie sich im Developer Mode befinden und die Schaltfläche Start Server grün ist. Unter Windows kann die Firewall den Port 1234 blockieren – erlauben Sie LM Studio in der Windows Defender-Firewall.
Modell nicht in der Suche gefunden
LM Studio listet nur GGUF-Repositories auf, die mit seiner Version von llama.cpp kompatibel sind. Für sehr neue Modelle aktualisieren Sie LM Studio (Help → Check for Updates) oder laden Sie die GGUF-Datei manuell herunter und legen Sie sie im Ordner models ab.
Linux: AppImage startet nicht
Installieren Sie libfuse2 (sudo apt install libfuse2 auf Ubuntu 22.04+). Bei Wayland exportieren Sie QT_QPA_PLATFORM=xcb, wenn die Anwendung nicht korrekt angezeigt wird.

#Weiterführende Informationen

Drei sinnvolle nächste Schritte, je nachdem, was Sie anschließend tun möchten:

Im Detail vergleichen
Der Leitfaden „LM Studio vs Ollama: Welches sollten Sie 2026 wählen?“ vergleicht die Funktionen einzeln und bietet eine Entscheidungsmatrix passend zu Ihrem Profil.
LM Studio mit Ihren PDF-Dateien verbinden
„Lokales RAG mit LM Studio: mit Ihren Dokumenten chatten“ erklärt die Funktion Chat with Documents, ihre Grenzen und wann Sie zu AnythingLLM wechseln sollten.
Weitere Beschleunigung der Inferenz
„LM Studio und MTP (Multi-Token Prediction)“ erklärt, wie Sie MTP bei kompatiblen Modellen aktivieren, um den Durchsatz um 30 bis 80 % zu steigern.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.