LM Studio in einen OpenAI-API-Server verwandeln (2026)
Öffnen Sie in LM Studio die Registerkarte Developer und aktivieren Sie den Schalter Start server: Der Server lauscht auf Port 1234 und stellt OpenAI-kompatible Endpunkte bereit (/v1/chat/completions, /v1/responses, /v1/embeddings, /v1/models). Jeder OpenAI-Client funktioniert, wenn Sie lediglich die Basisadresse ändern. Standardmäßig verlangt der Server keine Authentifizierung und lauscht nur auf localhost: API-Tokens und Netzwerkzugriff werden in Server Settings konfiguriert.
LM Studio ist mehr als eine Chat-Oberfläche: Sein lokaler Server ersetzt die OpenAI-API für Ihre Skripte, Ihre Code-Editoren und Ihre Agenten, ohne eine einzige Textzeile nach außen zu senden. Dieser Leitfaden behandelt die Aktivierung, jede Servereinstellung, den Netzwerkzugriff mit Authentifizierung, das Laden von Modellen bei Bedarf und die tatsächlichen Grenzen eines einzelnen Rechners. Dabei berücksichtigt er die Änderungen in Version 0.4.
#Was Sie erhalten
Am Ende dieses Leitfadens verfügen Sie über die Adresse http://localhost:1234/v1, die jedes OpenAI-SDK (Python, JavaScript, C#), LangChain oder ein Code-Tool wie Cline oder Continue anstelle der OpenAI-API nutzen kann. Der Server bietet außerdem eine native API unter /api/v1 (zustandsbehafteter Chat, Laden und Herunterladen von Modellen) sowie Anthropic-kompatible Endpunkte. Alles bleibt auf Ihrem Rechner: Das Modell, die Anfragen und die Antworten verlassen ihn nicht, solange Sie den Server nicht selbst im Netzwerk zugänglich machen.
#1. Server starten
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
- 01Öffnen Sie den Tab DeveloperIn LM Studio bündelt der Developer-Tab den Server, seine Protokolle und seine Einstellungen. Das Modell, das bereitgestellt werden soll, muss zuvor heruntergeladen werden.
- 02Aktivieren Sie Start serverAktivieren Sie den Schalter Start server: Der Server startet auf dem unter Server Settings angegebenen Port, in den Beispielen der Dokumentation auf Port 1234.
- 03Oder starten Sie über die BefehlszeileIn einem Terminal startet der Befehl lms server start denselben Server, ohne die Benutzeroberfläche zu öffnen.
- 04Prüfen Sie die Liste der ModelleFragen Sie /v1/models ab, um zu bestätigen, dass der Server antwortet, und die Modell-IDs anzuzeigen, die Sie in Ihren Anfragen verwenden sollen.
#2. Die Servereinstellungen im Einzelnen
Die Einstellungen befinden sich unter Developer, Server Settings. Sie bestimmen, wer den Server aufrufen darf und welche Aktionen die Clients vom Server ausführen lassen können. Die meisten Integrationsprobleme gehen auf einen dieser Schalter zurück, meist auf den für das Netzwerk oder CORS.
| Einstellung | Rolle | Empfehlung |
|---|---|---|
| Server Port | Port, auf dem der Server lauscht (1234 laut Dokumentation) | Ändern Sie ihn, wenn der Port bereits belegt ist |
| Require Authentication | Erfordert ein gültiges API-Token im Header Authorization | Aktivieren Sie die Einstellung, sobald der Server über localhost hinaus erreichbar ist. |
| Serve on Local Network | Macht den Server für andere Geräte im lokalen Netzwerk zugänglich | Standardmäßig deaktiviert; mit Authentifizierung kombinieren |
| Allow per-request MCPs | Erlaubt Clients die Nutzung kurzlebiger entfernter MCP-Server | Lassen Sie die Option deaktiviert, sofern Sie sie nicht für einen bestimmten Zweck benötigen. |
| Allow calling servers from mcp.json | Erlaubt Clients, die in LM Studio definierten MCP-Server zu nutzen | Erfordert Authentifizierung; riskant, wenn ein MCP auf Ihre Dateien zugreift |
| Enable CORS | Erlaubt Webanwendungen von anderen Ursprüngen | Nur für eine Webanwendung oder bestimmte Erweiterungen |
| Just in Time Model Loading | Lädt Modelle bei Bedarf zum Zeitpunkt der Anfrage | Praktisch mit Drittanbieter-Tools; siehe den entsprechenden Abschnitt |
| Auto Unload Unused JIT Models | Entlädt nicht mehr verwendete JIT-Modelle aus dem Speicher | Gibt Speicher frei |
| Only Keep Last JIT Loaded Model | Behält nur das zuletzt bei Bedarf geladene Modell im Speicher | Nützlich bei einer Grafikkarte mit begrenztem VRAM |
#3. Mit curl testen
Ein erster Testaufruf genügt, um die Funktion des Servers zu überprüfen. In den Anfragen muss das Feld model die Modellkennung so enthalten, wie sie in LM Studio angezeigt wird, und keinen generischen Namen wie local-model: Darauf weist die Dokumentation in ihrem curl-Beispiel hin.
Die Antwort ist ein JSON im OpenAI-Format: choices[0].message.content enthält den Text. Wenn der Wert im Feld model falsch ist oder das Laden bei Bedarf deaktiviert ist und das Modell nicht geladen ist, schlägt die Anfrage fehl: Überprüfen Sie zuerst die von /v1/models zurückgegebene Kennung.
#4. Aus Python aufrufen
Das SDK openai lässt sich verwenden, indem lediglich die Basisadresse geändert wird: Genau diese Änderung zeigt die Dokumentation von LM Studio. Das SDK verlangt einen Schlüssel; solange die Authentifizierung deaktiviert ist, prüft LM Studio ihn nicht. Wenn Sie die Authentifizierung aktivieren, wird der Schlüssel zu Ihrem API-Token.
Das Streaming funktioniert wie bei OpenAI: Auf Clientseite sind keine Änderungen erforderlich, um die Tokens in Echtzeit anzuzeigen. Für Agenten und Editoren implementiert LM Studio außerdem den Endpunkt /v1/responses, der weiter unten vorgestellt wird.
#Welche API wählen: OpenAI, Anthropic oder die native API
LM Studio bietet drei Familien von Endpoints an. Endpoints, die OpenAI kompatibel sind, umfassen Modelle, Antworten, Chats, Embeddings und Completions. Endpoints, die Anthropic kompatibel sind, akzeptieren das Anthropic-Format der Nachrichten. Ab Version 0.4.0 bietet die native API /api/v1 Funktionen spezifisch für LM Studio: Chat mit Zustand, Laden, Entfernen und Herunterladen von Modellen sowie die Kontext-Einstellung über die Anfrage.
| Bedarf | Endpoint | Hinweis |
|---|---|---|
| Die OpenAI-API in einem bestehenden Tool ersetzen | /v1/chat/completions | Streaming und benutzerdefinierte Tools unterstützt |
| Agent oder Client vom Typ Codex | /v1/responses | Zustandsbehafteter Chat und MCP verfügbar |
| Embeddings für ein RAG | /v1/embeddings | Vorab geladenes Embedding-Modell |
| Clients, die das Anthropic-Format verwenden | Anthropic-kompatible Endpunkte | Derselbe Server, anderes Nachrichtenformat |
| Ein Modell laden, entladen oder herunterladen | /api/v1/models/* | Native API, von LM Studio seit Version 0.4.0 empfohlen |
| Kontext in der Anfrage festlegen | /api/v1/chat | Einziger Endpunkt, der den Kontext pro Anfrage akzeptiert |
#6. Mehrere Modelle: Laden bei Bedarf und TTL
Beim Laden nach Bedarf (JIT, für Just in Time) lädt der erste Aufruf eines Modells dieses in den Speicher, und /v1/models listet alle heruntergeladenen Modelle auf, nicht nur die bereits geladenen. Ohne JIT gibt /v1/models nur die bereits geladenen Modelle zurück, und Sie müssen das Modell laden, bevor Sie es aufrufen. Dieser Modus ist ideal, wenn ein Tool wie Zed, Cline oder Continue sein Modell selbst auswählt.
- Standard-TTL
- Ein bei Bedarf geladenes Modell wird nach 60 Minuten ohne Anfrage aus dem Speicher entladen.
- TTL pro Anfrage
- Fügen Sie der Anfrage ein Feld ttl (in Sekunden) hinzu; 300 entspricht 5 Minuten.
- TTL für lms load
- Die mit lms load geladenen Modelle haben standardmäßig keine TTL: Verwenden Sie die Option --ttl.
- Auto-Evict
- Standardmäßig aktiviert: Es bleibt jeweils nur ein bei Bedarf geladenes Modell im Speicher. Deaktivieren Sie diese Option, um mehrere Modelle im Speicher zu behalten.
#7. Den Server mit Authentifizierung im Netzwerk verfügbar machen
Damit ein anderer Rechner im Netzwerk Ihren Server ansprechen kann, aktivieren Sie „Serve on Local Network“ unter „Server Settings“ oder starten Sie den Server mit der Bind-Adresse 0.0.0.0. Der Server lauscht dann nicht mehr ausschließlich auf localhost: Die Dokumentation warnt, dass jede Bind-Adresse außer 127.0.0.1 den Server auch außerhalb des Rechners erreichbar macht, und empfiehlt, die Authentifizierung zu aktivieren.
Entgegen einer weit verbreiteten Annahme kann LM Studio Anfragen authentifizieren. Standardmäßig verlangt es keine Authentifizierung; wenn Sie den Schalter in Server Settings aktivieren, akzeptiert es nur noch Anfragen mit einem gültigen API-Token, das in Manage Tokens mit den gewählten Berechtigungen erstellt wurde. Das Token wird nur bei der Erstellung angezeigt: Kopieren Sie es sofort. Diese Funktion erfordert LM Studio 0.4.0 oder eine neuere Version.
Für den Zugriff aus dem Internet geben Sie den Port nicht öffentlich frei: Nutzen Sie ein VPN oder einen Reverse-Proxy mit TLS. Das Prinzip ist dasselbe wie bei einem Ollama-Server und wird im Leitfaden zur Absicherung ausführlich beschrieben. Eine einfachere Alternative, um ein Modell auf einem anderen Rechner zu nutzen, ist LM Link: Es stellt ein Modell auf einem entfernten Gerät so bereit, als wäre es lokal geladen.
#Ohne grafische Oberfläche: llmster und automatischer Start
Seit Version 0.4.0 gibt es den Kern von LM Studio als eigenständigen Daemon namens llmster, der für den Betrieb ohne Benutzeroberfläche auf einem Linux-Server, einem GPU-Rechner oder einem lokalen Arbeitsplatzrechner ausgelegt ist. Er lässt sich mit einer einzigen Befehlszeile installieren und mit lms daemon up starten; anschließend wird der Server mit lms server start gestartet. Auf einem Rechner mit Benutzeroberfläche können Sie außerdem in den Anwendungseinstellungen die Option aktivieren, die den Server bei der Anmeldung startet: Beim Schließen wird die Anwendung dann in den Infobereich minimiert, und der Server läuft weiter.
#9. Leistung: das, was wirklich zählt
- GPU-Offload
- Laden Sie so viele Schichten wie möglich in den VRAM. Ein Modell, das teilweise in den Arbeitsspeicher ausgelagert wird, verliert den Großteil seines Durchsatzes.
- Context Length
- Wählen Sie den benötigten Kontext, nicht den maximalen: Der Kontextcache verbraucht VRAM und wächst mit der Länge.
- Max Concurrent Predictions
- Anzahl der gleichzeitigen Anfragen, die von einem Modell verarbeitet werden; darüber hinaus werden sie in einer Warteschlange abgelegt.
- Unified KV Cache
- Standardmäßig aktiviert: Die Ressourcen werden nicht in festen Anteilen auf die Anfragen verteilt, sodass unterschiedlich große Anfragen möglich sind.
Der Leitfaden zu Flash Attention und der zum Kontextfenster erläutern die Auswirkungen auf den Speicher im Detail. Für einen hohen Durchsatz bei mehreren Nutzern bleibt ein dedizierter Server besser geeignet: Der Leitfaden zu vLLM zeigt die Bereitstellung.
#Grenzen und Alternativen: Was sich geändert hat
Mehrere häufig genannte Einschränkungen treffen nicht mehr zu. Diese Angaben zu korrigieren, verändert die Wahl des Tools. Die Tabelle stellt die weiterhin verbreiteten Aussagen den Angaben der aktuellen Dokumentation gegenüber.
| Falsche Vorstellung | Tatsache |
|---|---|
| Keine Authentifizierung | API-Tokens ab Version 0.4.0 verfügbar, standardmäßig deaktiviert |
| Abfragen werden sequentiell ausgeführt | Version 0.4.0 verarbeitet parallele Anfragen an dasselbe Modell (kontinuierliches Batching) bis zur unter Max Concurrent Predictions festgelegten Grenze; weitere Anfragen warten |
| Kommerzielle Lizenz bei beruflicher Nutzung erforderlich | Seit Juli 2025 zu Hause und am Arbeitsplatz kostenlos, laut der Ankündigung von LM Studio |
| Ohne grafische Oberfläche nicht möglich | llmster läuft im Hintergrund, ohne grafische Oberfläche |
| Nur ein Rechner, keine gemeinsame Nutzung | Serve on Local Network und LM Link ermöglichen es, den Dienst für andere Geräte bereitzustellen |
Es bleiben echte Grenzen: LM Studio ist für einen einzelnen Arbeitsplatzrechner konzipiert, nicht für einen Cluster; kontinuierliches Batching ersetzt keinen Server wie vLLM, der für Dutzende Benutzer ausgelegt ist; und Updates der Anwendung können das Verhalten verändern, weshalb auf einem Rechner, der einen Dienst bereitstellt, die Version festgeschrieben werden muss. Um zwischen LM Studio und seinen Konkurrenten zu wählen, vergleichen Sie sie, bevor Sie sich festlegen.
- vLLM in der Produktion einsetzen
- Ollama vs LM Studio vs Jan vs GPT4All
- LM Studio unter Linux
- Cline an ein lokales Modell anschließen
- Quelle: Dokumentation LM Studio, lokaler API-Server
- Quelle: Dokumentation LM Studio, Server-Einstellungen
- Quelle: Dokumentation LM Studio, Authentifizierung
- Quelle: Dokumentation LM Studio, Kompatibilität mit OpenAI
- Quelle: Ankündigung von LM Studio 0.4.0
Wie aktiviert man den API-Server in LM Studio?+
Wie lässt sich der Server von LM Studio von einem anderen PC aus erreichen?+
Hat LM Studio eine Authentifizierung für seine API?+
Verarbeitet LM Studio mehrere Anfragen parallel?+
Welcher Identifikator soll im Feld 'model' eingegeben werden?+
Ist LM Studio für den Einsatz im Unternehmen kostenlos?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.