Mittelstufe 11 Min.LM Studio

LM Studio in einen OpenAI-API-Server verwandeln (2026)

Direkte Antwort

Öffnen Sie in LM Studio die Registerkarte Developer und aktivieren Sie den Schalter Start server: Der Server lauscht auf Port 1234 und stellt OpenAI-kompatible Endpunkte bereit (/v1/chat/completions, /v1/responses, /v1/embeddings, /v1/models). Jeder OpenAI-Client funktioniert, wenn Sie lediglich die Basisadresse ändern. Standardmäßig verlangt der Server keine Authentifizierung und lauscht nur auf localhost: API-Tokens und Netzwerkzugriff werden in Server Settings konfiguriert.

LM Studio ist mehr als eine Chat-Oberfläche: Sein lokaler Server ersetzt die OpenAI-API für Ihre Skripte, Ihre Code-Editoren und Ihre Agenten, ohne eine einzige Textzeile nach außen zu senden. Dieser Leitfaden behandelt die Aktivierung, jede Servereinstellung, den Netzwerkzugriff mit Authentifizierung, das Laden von Modellen bei Bedarf und die tatsächlichen Grenzen eines einzelnen Rechners. Dabei berücksichtigt er die Änderungen in Version 0.4.

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet

#Was Sie erhalten

Am Ende dieses Leitfadens verfügen Sie über die Adresse http://localhost:1234/v1, die jedes OpenAI-SDK (Python, JavaScript, C#), LangChain oder ein Code-Tool wie Cline oder Continue anstelle der OpenAI-API nutzen kann. Der Server bietet außerdem eine native API unter /api/v1 (zustandsbehafteter Chat, Laden und Herunterladen von Modellen) sowie Anthropic-kompatible Endpunkte. Alles bleibt auf Ihrem Rechner: Das Modell, die Anfragen und die Antworten verlassen ihn nicht, solange Sie den Server nicht selbst im Netzwerk zugänglich machen.

#1. Server starten

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen
  1. 01
    Öffnen Sie den Tab Developer
    In LM Studio bündelt der Developer-Tab den Server, seine Protokolle und seine Einstellungen. Das Modell, das bereitgestellt werden soll, muss zuvor heruntergeladen werden.
  2. 02
    Aktivieren Sie Start server
    Aktivieren Sie den Schalter Start server: Der Server startet auf dem unter Server Settings angegebenen Port, in den Beispielen der Dokumentation auf Port 1234.
  3. 03
    Oder starten Sie über die Befehlszeile
    In einem Terminal startet der Befehl lms server start denselben Server, ohne die Benutzeroberfläche zu öffnen.
  4. 04
    Prüfen Sie die Liste der Modelle
    Fragen Sie /v1/models ab, um zu bestätigen, dass der Server antwortet, und die Modell-IDs anzuzeigen, die Sie in Ihren Anfragen verwenden sollen.
Den Server über das Terminal starten
lms server start

#2. Die Servereinstellungen im Einzelnen

Die Einstellungen befinden sich unter Developer, Server Settings. Sie bestimmen, wer den Server aufrufen darf und welche Aktionen die Clients vom Server ausführen lassen können. Die meisten Integrationsprobleme gehen auf einen dieser Schalter zurück, meist auf den für das Netzwerk oder CORS.

Server-Einstellungen von LM Studio (offizielle Dokumentation)
EinstellungRolleEmpfehlung
Server PortPort, auf dem der Server lauscht (1234 laut Dokumentation)Ändern Sie ihn, wenn der Port bereits belegt ist
Require AuthenticationErfordert ein gültiges API-Token im Header AuthorizationAktivieren Sie die Einstellung, sobald der Server über localhost hinaus erreichbar ist.
Serve on Local NetworkMacht den Server für andere Geräte im lokalen Netzwerk zugänglichStandardmäßig deaktiviert; mit Authentifizierung kombinieren
Allow per-request MCPsErlaubt Clients die Nutzung kurzlebiger entfernter MCP-ServerLassen Sie die Option deaktiviert, sofern Sie sie nicht für einen bestimmten Zweck benötigen.
Allow calling servers from mcp.jsonErlaubt Clients, die in LM Studio definierten MCP-Server zu nutzenErfordert Authentifizierung; riskant, wenn ein MCP auf Ihre Dateien zugreift
Enable CORSErlaubt Webanwendungen von anderen UrsprüngenNur für eine Webanwendung oder bestimmte Erweiterungen
Just in Time Model LoadingLädt Modelle bei Bedarf zum Zeitpunkt der AnfragePraktisch mit Drittanbieter-Tools; siehe den entsprechenden Abschnitt
Auto Unload Unused JIT ModelsEntlädt nicht mehr verwendete JIT-Modelle aus dem SpeicherGibt Speicher frei
Only Keep Last JIT Loaded ModelBehält nur das zuletzt bei Bedarf geladene Modell im SpeicherNützlich bei einer Grafikkarte mit begrenztem VRAM
!
Eine Einstellung, die Ihre Dateien zugänglich macht
Die Option, die Aufrufe der in mcp.json definierten Server erlaubt, gibt API-Clients Zugriff auf die dort von Ihnen festgelegten Tools. Die Dokumentation rät davon ab, diese Option ohne Authentifizierung zu verwenden, und verlangt zudem, dass Require Authentication aktiviert ist. Aktivieren Sie diese Option nur, wenn Sie den Umfang der Zugriffsmöglichkeiten jedes eingetragenen MCP-Servers kennen.

#3. Mit curl testen

Ein erster Testaufruf genügt, um die Funktion des Servers zu überprüfen. In den Anfragen muss das Feld model die Modellkennung so enthalten, wie sie in LM Studio angezeigt wird, und keinen generischen Namen wie local-model: Darauf weist die Dokumentation in ihrem curl-Beispiel hin.

Liste der Modelle
curl http://localhost:1234/v1/models
Chat-Vervollständigung
curl http://localhost:1234/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "IDENTIFIANT-DU-MODELE",
    "messages": [
      {"role":"system","content":"Tu es concis."},
      {"role":"user","content":"Capitale du Portugal ?"}
    ],
    "temperature": 0.2
  }'

Die Antwort ist ein JSON im OpenAI-Format: choices[0].message.content enthält den Text. Wenn der Wert im Feld model falsch ist oder das Laden bei Bedarf deaktiviert ist und das Modell nicht geladen ist, schlägt die Anfrage fehl: Überprüfen Sie zuerst die von /v1/models zurückgegebene Kennung.

#4. Aus Python aufrufen

Das SDK openai lässt sich verwenden, indem lediglich die Basisadresse geändert wird: Genau diese Änderung zeigt die Dokumentation von LM Studio. Das SDK verlangt einen Schlüssel; solange die Authentifizierung deaktiviert ist, prüft LM Studio ihn nicht. Wenn Sie die Authentifizierung aktivieren, wird der Schlüssel zu Ihrem API-Token.

Über das openai-SDK
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:1234/v1",
    api_key="lm-studio",  # ignorée sans authentification ; votre jeton sinon
)

resp = client.chat.completions.create(
    model="IDENTIFIANT-DU-MODELE",
    messages=[
        {"role": "system", "content": "Réponds en 1 phrase."},
        {"role": "user",   "content": "Qu'est-ce qu'un LLM ?"},
    ],
    temperature=0.3,
    stream=True,
)

for chunk in resp:
    delta = chunk.choices[0].delta.content or ""
    print(delta, end="", flush=True)

Das Streaming funktioniert wie bei OpenAI: Auf Clientseite sind keine Änderungen erforderlich, um die Tokens in Echtzeit anzuzeigen. Für Agenten und Editoren implementiert LM Studio außerdem den Endpunkt /v1/responses, der weiter unten vorgestellt wird.

#Welche API wählen: OpenAI, Anthropic oder die native API

LM Studio bietet drei Familien von Endpoints an. Endpoints, die OpenAI kompatibel sind, umfassen Modelle, Antworten, Chats, Embeddings und Completions. Endpoints, die Anthropic kompatibel sind, akzeptieren das Anthropic-Format der Nachrichten. Ab Version 0.4.0 bietet die native API /api/v1 Funktionen spezifisch für LM Studio: Chat mit Zustand, Laden, Entfernen und Herunterladen von Modellen sowie die Kontext-Einstellung über die Anfrage.

Endpunkte nach Bedarf
BedarfEndpointHinweis
Die OpenAI-API in einem bestehenden Tool ersetzen/v1/chat/completionsStreaming und benutzerdefinierte Tools unterstützt
Agent oder Client vom Typ Codex/v1/responsesZustandsbehafteter Chat und MCP verfügbar
Embeddings für ein RAG/v1/embeddingsVorab geladenes Embedding-Modell
Clients, die das Anthropic-Format verwendenAnthropic-kompatible EndpunkteDerselbe Server, anderes Nachrichtenformat
Ein Modell laden, entladen oder herunterladen/api/v1/models/*Native API, von LM Studio seit Version 0.4.0 empfohlen
Kontext in der Anfrage festlegen/api/v1/chatEinziger Endpunkt, der den Kontext pro Anfrage akzeptiert

#6. Mehrere Modelle: Laden bei Bedarf und TTL

Beim Laden nach Bedarf (JIT, für Just in Time) lädt der erste Aufruf eines Modells dieses in den Speicher, und /v1/models listet alle heruntergeladenen Modelle auf, nicht nur die bereits geladenen. Ohne JIT gibt /v1/models nur die bereits geladenen Modelle zurück, und Sie müssen das Modell laden, bevor Sie es aufrufen. Dieser Modus ist ideal, wenn ein Tool wie Zed, Cline oder Continue sein Modell selbst auswählt.

Standard-TTL
Ein bei Bedarf geladenes Modell wird nach 60 Minuten ohne Anfrage aus dem Speicher entladen.
TTL pro Anfrage
Fügen Sie der Anfrage ein Feld ttl (in Sekunden) hinzu; 300 entspricht 5 Minuten.
TTL für lms load
Die mit lms load geladenen Modelle haben standardmäßig keine TTL: Verwenden Sie die Option --ttl.
Auto-Evict
Standardmäßig aktiviert: Es bleibt jeweils nur ein bei Bedarf geladenes Modell im Speicher. Deaktivieren Sie diese Option, um mehrere Modelle im Speicher zu behalten.
!
Zwei Modelle, doppelt so viele Modellgewichte
Auto-Evict entlädt das vorherige Modell, bevor das neue geladen wird. Wenn Sie dies deaktivieren, addieren sich die Gewichte: Ein Modell mit 8 Milliarden Parametern in Q4 (etwa 5 GB) und ein Modell mit 9 Milliarden (etwa 6 GB) beanspruchen zusammen mehr als 10 GB, bevor der Kontext überhaupt geladen ist. Achten Sie auf die VRAM.

#7. Den Server mit Authentifizierung im Netzwerk verfügbar machen

Damit ein anderer Rechner im Netzwerk Ihren Server ansprechen kann, aktivieren Sie „Serve on Local Network“ unter „Server Settings“ oder starten Sie den Server mit der Bind-Adresse 0.0.0.0. Der Server lauscht dann nicht mehr ausschließlich auf localhost: Die Dokumentation warnt, dass jede Bind-Adresse außer 127.0.0.1 den Server auch außerhalb des Rechners erreichbar macht, und empfiehlt, die Authentifizierung zu aktivieren.

Auf allen IPv4-Schnittstellen lauschen
lms server start --bind 0.0.0.0
Remote-Client
curl http://192.168.1.42:1234/v1/models

Entgegen einer weit verbreiteten Annahme kann LM Studio Anfragen authentifizieren. Standardmäßig verlangt es keine Authentifizierung; wenn Sie den Schalter in Server Settings aktivieren, akzeptiert es nur noch Anfragen mit einem gültigen API-Token, das in Manage Tokens mit den gewählten Berechtigungen erstellt wurde. Das Token wird nur bei der Erstellung angezeigt: Kopieren Sie es sofort. Diese Funktion erfordert LM Studio 0.4.0 oder eine neuere Version.

API-Token-basierter Aufruf
curl http://192.168.1.42:1234/v1/models \
  -H "Authorization: Bearer $LM_API_TOKEN"

Für den Zugriff aus dem Internet geben Sie den Port nicht öffentlich frei: Nutzen Sie ein VPN oder einen Reverse-Proxy mit TLS. Das Prinzip ist dasselbe wie bei einem Ollama-Server und wird im Leitfaden zur Absicherung ausführlich beschrieben. Eine einfachere Alternative, um ein Modell auf einem anderen Rechner zu nutzen, ist LM Link: Es stellt ein Modell auf einem entfernten Gerät so bereit, als wäre es lokal geladen.

#Ohne grafische Oberfläche: llmster und automatischer Start

Seit Version 0.4.0 gibt es den Kern von LM Studio als eigenständigen Daemon namens llmster, der für den Betrieb ohne Benutzeroberfläche auf einem Linux-Server, einem GPU-Rechner oder einem lokalen Arbeitsplatzrechner ausgelegt ist. Er lässt sich mit einer einzigen Befehlszeile installieren und mit lms daemon up starten; anschließend wird der Server mit lms server start gestartet. Auf einem Rechner mit Benutzeroberfläche können Sie außerdem in den Anwendungseinstellungen die Option aktivieren, die den Server bei der Anmeldung startet: Beim Schließen wird die Anwendung dann in den Infobereich minimiert, und der Server läuft weiter.

llmster installieren und starten (Linux und Mac)
curl -fsSL https://lmstudio.ai/install.sh | bash
lms daemon up
lms server start

#9. Leistung: das, was wirklich zählt

GPU-Offload
Laden Sie so viele Schichten wie möglich in den VRAM. Ein Modell, das teilweise in den Arbeitsspeicher ausgelagert wird, verliert den Großteil seines Durchsatzes.
Context Length
Wählen Sie den benötigten Kontext, nicht den maximalen: Der Kontextcache verbraucht VRAM und wächst mit der Länge.
Max Concurrent Predictions
Anzahl der gleichzeitigen Anfragen, die von einem Modell verarbeitet werden; darüber hinaus werden sie in einer Warteschlange abgelegt.
Unified KV Cache
Standardmäßig aktiviert: Die Ressourcen werden nicht in festen Anteilen auf die Anfragen verteilt, sodass unterschiedlich große Anfragen möglich sind.

Der Leitfaden zu Flash Attention und der zum Kontextfenster erläutern die Auswirkungen auf den Speicher im Detail. Für einen hohen Durchsatz bei mehreren Nutzern bleibt ein dedizierter Server besser geeignet: Der Leitfaden zu vLLM zeigt die Bereitstellung.

#Grenzen und Alternativen: Was sich geändert hat

Mehrere häufig genannte Einschränkungen treffen nicht mehr zu. Diese Angaben zu korrigieren, verändert die Wahl des Tools. Die Tabelle stellt die weiterhin verbreiteten Aussagen den Angaben der aktuellen Dokumentation gegenüber.

Falsche Vorstellungen und die Wirklichkeit (Dokumentation LM Studio, 2026)
Falsche VorstellungTatsache
Keine AuthentifizierungAPI-Tokens ab Version 0.4.0 verfügbar, standardmäßig deaktiviert
Abfragen werden sequentiell ausgeführtVersion 0.4.0 verarbeitet parallele Anfragen an dasselbe Modell (kontinuierliches Batching) bis zur unter Max Concurrent Predictions festgelegten Grenze; weitere Anfragen warten
Kommerzielle Lizenz bei beruflicher Nutzung erforderlichSeit Juli 2025 zu Hause und am Arbeitsplatz kostenlos, laut der Ankündigung von LM Studio
Ohne grafische Oberfläche nicht möglichllmster läuft im Hintergrund, ohne grafische Oberfläche
Nur ein Rechner, keine gemeinsame NutzungServe on Local Network und LM Link ermöglichen es, den Dienst für andere Geräte bereitzustellen

Es bleiben echte Grenzen: LM Studio ist für einen einzelnen Arbeitsplatzrechner konzipiert, nicht für einen Cluster; kontinuierliches Batching ersetzt keinen Server wie vLLM, der für Dutzende Benutzer ausgelegt ist; und Updates der Anwendung können das Verhalten verändern, weshalb auf einem Rechner, der einen Dienst bereitstellt, die Version festgeschrieben werden muss. Um zwischen LM Studio und seinen Konkurrenten zu wählen, vergleichen Sie sie, bevor Sie sich festlegen.

FAQ
Wie aktiviert man den API-Server in LM Studio?+
Öffnen Sie den Tab Developer und aktivieren Sie den Schalter Start server, oder führen Sie den Befehl lms server start in einem Terminal aus. Der Server lauscht auf dem in Server Settings eingestellten Port; in der Dokumentation ist das Port 1234. Testen Sie ihn mit curl http://localhost:1234/v1/models. Die Anfrage gibt die verfügbaren Modelle zurück; wenn die Liste leer ist, laden Sie zuerst ein Modell oder aktivieren Sie das Laden bei Bedarf in Server Settings.
Wie lässt sich der Server von LM Studio von einem anderen PC aus erreichen?+
Aktivieren Sie „Serve on Local Network“ unter „Server Settings“ oder starten Sie den Server mit lms server start --bind 0.0.0.0. Der Server lauscht dann nicht mehr nur auf localhost: Aktivieren Sie auch die Authentifizierung per API-Token, da die Dokumentation diese Vorsichtsmaßnahme für jede Bind-Adresse außer 127.0.0.1 empfiehlt. Verwenden Sie von einem anderen Rechner aus die IP-Adresse des Rechners, auf dem der Server läuft, und denselben Port, beispielsweise http://192.168.1.42:1234/v1.
Hat LM Studio eine Authentifizierung für seine API?+
Ja, seit Version 0.4.0: API-Tokens werden unter Manage Tokens erstellt und über Require Authentication in Server Settings aktiviert. Standardmäßig ist keine Authentifizierung erforderlich. Sobald sie aktiviert ist, müssen alle REST-Anfragen und alle Anfragen der SDKs ein gültiges Token im Authorization-Header enthalten.
Verarbeitet LM Studio mehrere Anfragen parallel?+
Ja, seit Version 0.4.0, die parallele Anfragen an dasselbe Modell mit kontinuierlichem Batching eingeführt hat. Die Einstellung Max Concurrent Predictions legt die Anzahl gleichzeitiger Anfragen fest; darüber hinaus müssen die Anfragen warten. Für intensiven Mehrbenutzerbetrieb mit Dutzenden gleichzeitiger Anfragen bleibt ein dafür ausgelegter Server wie vLLM besser geeignet.
Welcher Identifikator soll im Feld 'model' eingegeben werden?+
Die Modell-ID, wie sie in LM Studio angezeigt wird, und kein generischer Name. Die Anfrage /v1/models listet die IDs auf. Wenn das Laden bei Bedarf aktiviert ist, gibt sie alle heruntergeladenen Modelle zurück; andernfalls nur diejenigen, die bereits in den Speicher geladen sind. Kopieren Sie die genaue ID in Ihren Client, denn ein Tippfehler lässt die Anfrage fehlschlagen.
Ist LM Studio für den Einsatz im Unternehmen kostenlos?+
Ja: Seit dem 8. Juli 2025 ist LM Studio laut Ankündigung des Anbieters sowohl zu Hause als auch bei der Arbeit kostenlos, ohne dass eine kommerzielle Lizenz beantragt werden muss. Für zusätzliche Anforderungen gibt es kommerzielle Angebote. Prüfen Sie vor einer Bereitstellung die aktuell geltenden Nutzungsbedingungen, insbesondere wenn Sie die kommerziellen Angebote des Anbieters nutzen möchten.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.