LM Studio: vollständiges Tutorial 2026 (Installation, API)
LM Studio ist eine Desktop-Anwendung, die Ihre Maschine in einen lokalen LLM-Server verwandelt, ohne den Terminalzugriff zu berühren. Die Version 0.3+ bietet Unterstützung für MCP, einen verbesserten GGUF-Engine und eine direkte Modellherunterladefunktion über Hugging Face. Hier finden Sie ein umfassendes Tutorial LM Studio 2026: Installation auf den drei Betriebssystemen, Erste Schritte mit einem Modell, Einrichtung eines OpenAI-kompatiblen Servers auf Port 1234 und eine ehrliche Vergleich mit Ollama und Jan.
#Erstes Ergebnis: Herunterladen, Laden, Überprüfen
Die offizielle Dokumentation beschreibt den Ablauf Discover → Herunterladen → Chat → Laden des Modells. Wählen Sie die Datei für Ihre Engine: GGUF für llama.cpp oder eine kompatible MLX-Distribution auf Apple Silicon. Ein heruntergeladenes Modell ist noch nicht geladen. Beginnen Sie mit einem kurzen Kontext und stellen Sie dann eine einfache Frage, bevor Sie Dokumente oder einen API-Server hinzufügen.
Falls die Speicherressourcen nicht ausreichen, verringern Sie den Kontext und wählen Sie eine kleinere Datei; steuern Sie den GPU-Offload. Der Modell- und Kontextverbrauch teilt sich den Budget mit dem System auf Apple Silicon. Die Windows/macOS-Anweisungen wurden in der Dokumentation überprüft; der Ordner vom 12. September wurde unter Linux mit Ollama ausgeführt, nicht mit LM Studio.
- Offizielle Anleitung für den Einstieg
- Offizielle Ladeparameter
- Speicherbudget prüfen
- Qwen3 8B-Datenblatt
- Einen ersten kostenlosen Einstieg wählen
#Warum LM Studio im Jahr 2026
LM Studio ist installiert und Ihr erstes Modell antwortet. Die nächsten Schritte finden Sie im Kit für lokale KI: das zu Ihrem Rechner passende Modell auswählen (Kap. 3), die Möglichkeiten von LM Studio weiter ausschöpfen (Kap. 5) und es anschließend Ihre eigenen Dokumente lesen lassen (Kap. 8).
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
LM Studio besetzt eine klar umrissene Nische: Nutzer, die eine richtige grafische Anwendung statt eines CLI-Daemons möchten. Sie öffnen die App, suchen in der integrierten Suchleiste (die auf Hugging Face zugreift) nach einem Modell, klicken auf Download und chatten. Keine Konfigurationsdatei, keine Kommandozeile.
Unter der Haube enthält LM Studio llama.cpp mit Unterstützung für CUDA, Metal, Vulkan und ROCm sowie eine speziell für Macs mit Apple Silicon vorgesehene MLX-Engine. Version 0.3 führte die Ansicht „Power User“ ein, die alle Parameter zugänglich macht (KV-Cache-Typ, Flash Attention, GPU-Offloading Schicht für Schicht), und Version 0.3.x ergänzte die native Unterstützung für MCP-Server – Sie verbinden Ihr lokales Modell mit Tools wie einem Dateisystem oder einer Datenbank, ohne zu programmieren.
#Voraussetzungen
- Windows
- Windows 10/11, 64 Bit. AVX2 erforderlich (alle CPUs seit 2014). CUDA-Unterstützung bei NVIDIA-GPUs, andernfalls Vulkan.
- macOS
- macOS 13.4+ auf Apple Silicon (M1/M2/M3/M4). Macs mit Intel-Prozessoren werden seit Version 0.3 nicht mehr unterstützt.
- Linux
- AppImage x86_64, glibc 2.35+ (Ubuntu 22.04, Fedora 36, Arch aktuell). ARM64-Build für SBC verfügbar.
- RAM
- 16 GB sind das Minimum für eine komfortable Nutzung, 8 GB sind knapp. Planen Sie für ein 14B-Modell in Q4 12 GB freien RAM ein; für ein 32B-Modell 24 GB.
- Festplatte
- Rechnen Sie mit 30 bis 50 GB: Ein Modell mit 14 Milliarden Parametern in Q4 benötigt etwa 9 GB, und Sie werden mehrere herunterladen.
#1. Installation unter Windows, Mac und Linux
Laden Sie das Installationsprogramm für Ihr Betriebssystem von der offiziellen Website herunter. Kein npm-Paket, kein Homebrew – es handelt sich um eine klassische Desktop-Anwendung.
- 01WindowsStarten Sie LM-Studio-Setup.exe. SmartScreen kann die Binärdatei beim ersten Start blockieren — klicken Sie auf „Weitere Informationen“ und dann auf „Dennoch ausführen“. Die Anwendung wird unter %LOCALAPPDATA%\Programs\lm-studio installiert.
- 02macOSÖffnen Sie die .dmg-Datei und ziehen Sie LM Studio.app in /Applications. Beim ersten Start kann Gatekeeper Sie auffordern, die App unter Réglages → Confidentialité et sécurité zuzulassen. Auf Apple Silicon ist die MLX-Engine standardmäßig aktiviert.
- 03LinuxLaden Sie die AppImage herunter, machen Sie sie mit chmod +x LM_Studio-0.3.x.AppImage ausführbar und starten Sie sie anschließend. Um sie in das Menü zu integrieren, verwenden Sie AppImageLauncher oder erstellen Sie manuell eine .desktop-Datei.
#2. Qwen3-Coder im GGUF-Format herunterladen
Die Registerkarte Discover (Lupe) ist Ihr Zugang zu Hugging Face. Geben Sie den Namen eines Modells ein, wählen Sie eine Quantisierung und klicken Sie auf Download. Für dieses Tutorial verwenden wir Qwen3-Coder-30B-A3B, das Open-Weight-Coding-Modell, das für Nutzer mit mindestens 16 GB VRAM als Referenz gilt.
- 01Das Modell suchenGeben Sie in Discover "qwen3-coder" ein. LM Studio zeigt die kompatiblen GGUF-Repositories an (in der Regel bartowski, unsloth, lmstudio-community). Bevorzugen Sie die Repositories lmstudio-community oder bartowski: Deren GGUF-Dateien sind für die aktuelle Version der Engine validiert.
- 02Die Quantisierung wählenBei 24 GB VRAM bietet Q4_K_M das beste Verhältnis (Qualität ~99 % von FP16, Größe ~17 GB). Bei 16 GB gehen Sie auf Q3_K_M herunter. Bei 32 GB oder einem Mac Studio wählen Sie Q5_K_M oder Q8_0, wenn Ihnen maximale Genauigkeit wichtig ist.
- 03Download startenKlicken Sie auf Download. Der Fortschritt wird im Tab Downloads angezeigt. Bei einem Glasfaseranschluss sollten Sie für eine 17 GB große Datei etwa 5 Minuten einplanen.
- 04Modell ladenWechseln Sie zum Tab Chat, öffnen Sie oben das Auswahlmenü und wählen Sie Qwen3-Coder. Wenn Sie den Modus Power User verwenden, passen Sie GPU Offload (standardmäßig wählt LM Studio den höchsten sicheren Wert) und Context Length (32k sind für Code komfortabel) an und aktivieren Sie Flash Attention.
#3. Erster Chat und GPU-Prüfung
Sobald das Modell geladen ist, stellen Sie eine Frage im Chat. LM Studio zeigt unten bei jeder Antwort die Tokens pro Sekunde, die Zeit bis zum ersten Token und den tatsächlichen VRAM-Verbrauch an. Das ist klarer als das parallele Ausführen von nvidia-smi.
Auf einer RTX 4090 erreicht Qwen3-Coder-30B-A3B in Q4 dank seiner MoE-Architektur etwa 90–120 Tok/s (3B aktive Parameter von insgesamt 30B). Auf einem M4 Pro mit 48 GB können Sie mit der MLX-Engine mit 35–50 Tok/s rechnen. Auf einer RTX 3060 mit 12 GB passt das 30B-Modell nicht in den Speicher – wechseln Sie zu Qwen 3.5 9B (~6,6 GB in Q4), das problemlos hineinpasst und noch Spielraum für den Kontext lässt.
#4. OpenAI-kompatibler Server auf dem Port 1234
Das ist der Vorteil, den viele nicht kennen: LM Studio stellt einen HTTP-Server bereit, der mit der OpenAI-API kompatibel ist, standardmäßig unter http://localhost:1234. Sie können daher jeden OpenAI-Client (Python-SDK, LangChain, Continue.dev, Cursor, Ihre selbst entwickelte App) an LM Studio anbinden, ohne eine einzige Zeile der Geschäftslogik zu ändern — nur die Basis-URL und den Schlüssel müssen Sie ändern.
- 01Developer Mode aktivierenÄndern Sie unten links die Benutzerrolle auf „Developer“. Die Registerkarte Local Server (Terminal-Symbol) erscheint in der linken Seitenleiste.
- 02Server startenRegisterkarte Local Server → wählen Sie im oberen Menü das Modell aus, das Sie bereitstellen möchten → klicken Sie auf Start Server. Standardmäßig lauscht der Server auf localhost:1234. Aktivieren Sie "Serve on Local Network", wenn Sie ihn für andere Rechner in Ihrem LAN zugänglich machen möchten.
- 03Den Endpunkt prüfenDer Server bietet die Endpunkte /v1/models, /v1/chat/completions, /v1/completions, /v1/embeddings (wenn ein Embedding-Modell geladen ist) an. Testen Sie zunächst die Liste der Modelle.
#5. Native Unterstützung von MCP
Seit Version 0.3.17 unterstützt LM Studio das Model Context Protocol (MCP) – den von Anthropic 2024 eingeführten Standard zur Anbindung externer Tools an ein LLM. Konkret: Ihr lokales Modell kann auf Ihr Dateisystem zugreifen, SQL ausführen und eine API aufrufen, sofern ein MCP-Server konfiguriert ist.
Die Konfiguration erfolgt in der Datei mcp.json, die über das Menü Program → Edit mcp.json erreichbar ist. Hier ist ein Beispiel, das den offiziellen filesystem-Server von Anthropic und einen SQLite-Server hinzufügt.
Nach der Registrierung erscheinen die MCP-Tools unter dem Steckersymbol (Plug) im Chat. Sie können sie bei Bedarf aktivieren. Das Modell entscheidet anschließend, wann es sie aufruft: Das ist nützlich, um ohne Programmierung einen lokalen Mini-Agenten zu erstellen, etwa für „Fasse alle PDFs im Ordner Recherche zusammen“ oder „Wie viele Zeilen enthält die Tabelle users?“.
#LM Studio vs Ollama vs Jan
Die drei Tools verfolgen dasselbe Ziel (LLM lokal ohne Cloud), setzen dabei aber auf unterschiedliche Ansätze.
- LM Studio
- Funktionsreiche Desktop-App, integrierte HF-Suche, API-Server auf Port :1234, MCP-Unterstützung, MLX auf dem Mac. Closed Source, aber kostenlos. Ideal, wenn Sie alles in einer Anwendung mit einer ausgereiften grafischen Oberfläche möchten.
- Ollama
- Leichter Daemon + CLI, lauscht auf :11434, riesige Bibliothek vorkonfigurierter Modelle (ollama run qwen3.5:9b), stabile API, zahlreiche Integrationen (Cline, Open WebUI, n8n). Open Source. Ideal, wenn Sie mit dem Terminal vertraut sind und einen Betrieb ohne grafische Oberfläche wünschen.
- Jan
- Open-Source-Desktop-App (AGPL) mit einer radikalen „Offline-first“-Philosophie, jünger und mit weniger Funktionen als LM Studio. Eine gute Wahl, wenn Ihnen Open Source wichtig ist und Sie eine Desktop-App möchten.
#Fehlerbehebung
- Das Modell lädt nicht (OOM)
- Reduzieren Sie GPU Offload manuell in den Settings des Chats. Wenn Sie das Modell zu 100 % auf die GPU auslagern und es dabei abstürzt, reduzieren Sie den Wert auf 80 % – einige Schichten werden dann in den Arbeitsspeicher verlagert. Das ist langsamer, aber das Modell läuft.
- Sehr wenige Tokens pro Sekunde
- Prüfen Sie, ob Flash Attention aktiviert ist und „KV cache type“ auf Q8_0 eingestellt ist (nicht auf FP16). Im Modus „Power User“ finden Sie diese Einstellungen in der rechten Seitenleiste des Chats.
- Der API-Server antwortet nicht
- Vergewissern Sie sich, dass Sie sich im Developer Mode befinden und die Schaltfläche Start Server grün ist. Unter Windows kann die Firewall den Port 1234 blockieren – erlauben Sie LM Studio in der Windows Defender-Firewall.
- Modell nicht in der Suche gefunden
- LM Studio listet nur GGUF-Repositories auf, die mit seiner Version von llama.cpp kompatibel sind. Für sehr neue Modelle aktualisieren Sie LM Studio (Help → Check for Updates) oder laden Sie die GGUF-Datei manuell herunter und legen Sie sie im Ordner models ab.
- Linux: AppImage startet nicht
- Installieren Sie libfuse2 (sudo apt install libfuse2 auf Ubuntu 22.04+). Bei Wayland exportieren Sie QT_QPA_PLATFORM=xcb, wenn die Anwendung nicht korrekt angezeigt wird.
#Weiterführende Informationen
Drei sinnvolle nächste Schritte, je nachdem, was Sie anschließend tun möchten:
- Im Detail vergleichen
- Der Leitfaden „LM Studio vs Ollama: Welches sollten Sie 2026 wählen?“ vergleicht die Funktionen einzeln und bietet eine Entscheidungsmatrix passend zu Ihrem Profil.
- LM Studio mit Ihren PDF-Dateien verbinden
- „Lokales RAG mit LM Studio: mit Ihren Dokumenten chatten“ erklärt die Funktion Chat with Documents, ihre Grenzen und wann Sie zu AnythingLLM wechseln sollten.
- Weitere Beschleunigung der Inferenz
- „LM Studio und MTP (Multi-Token Prediction)“ erklärt, wie Sie MTP bei kompatiblen Modellen aktivieren, um den Durchsatz um 30 bis 80 % zu steigern.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.