Einsteiger 9 Min.Oberflächen

LM Studio unter Linux: Ubuntu, Debian, Arch, Fedora (2026)

LM Studio unter Linux ist eine etwa 600 MB große AppImage, die eine grafische Oberfläche, einen mit Hugging Face verbundenen Modell-Store, eine llama.cpp-Inferenz-Engine und einen OpenAI-kompatiblen Server bündelt. Keine Systeminstallation, kein Daemon, kein Repository, das hinzugefügt werden muss — eine ausführbare Datei, und das ist alles. Dieser Leitfaden behandelt die Installation, das Herunterladen eines GGUF-Modells, den Start des lokalen Servers und die Linux-spezifischen Stolperfallen (Berechtigungen, FUSE, GPU).

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Getestet auf Ubuntu 24.04
i
Kurz gesagt
LM Studio unter Linux ist eine etwa 600 MB große AppImage: keine Systeminstallation, kein Daemon, nur eine ausführbare Datei. · Drei Schritte reichen aus: die Datei herunterladen, sie ausführbar machen (chmod +x) und dann starten. · Voraussetzungen: eine aktuelle Distribution mit glibc 2.35+ und das Paket libfuse2 unter Ubuntu 22.04 und höher. · Die AppImage erkennt automatisch die GPU (CUDA, ROCm oder Vulkan, je nach Grafikkarte), um die Inferenz zu beschleunigen.

#Warum LM Studio auf Linux

Unter Linux greift man für ein lokales LLM meist zu Ollama: systemd-Daemon, übersichtliche CLI, standardmäßig auf localhost:11434 erreichbar. Für den Serverbetrieb ist das hervorragend. LM Studio verfolgt einen anderen Ansatz — den des Arbeitsplatzrechners mit grafischer Oberfläche.

Eine umfassende Benutzeroberfläche ohne Terminal
Chat, Hugging-Face-Modellbrowser, Download-Manager, Sampling-Einstellungen: alles in einer grafischen Oberfläche. Nützlich, wenn Sie schnell mehrere Modelle testen möchten, bevor Sie in den Produktivbetrieb wechseln.
Ein OpenAI-kompatibler Server mit einem Klick
Der Tab Developer stellt unter http://localhost:1234/v1 einen Endpunkt bereit, der das OpenAI-Protokoll verwendet. Jedes SDK (openai-python, LangChain, Continue.dev) kann darauf zugreifen, ohne eine einzige Codezeile zu ändern.
Keine Systeminstallation
Das AppImage läuft im Benutzerbereich. Kein sudo, kein Paket zu installieren, kein Drittanbieter-Repository. Für Rechner mit Einschränkungen durch die IT-Abteilung oder für ungewöhnliche Distributionen ist das wertvoll.
Natives GGUF-Format
LM Studio liest ausschließlich das GGUF-Format (das Format von llama.cpp). Es ist dasselbe Format, das Ollama intern verwendet, daher sind 100 % der beliebten Modelle verfügbar.
i
LM Studio und Ollama lassen sich problemlos nebeneinander betreiben
Nichts spricht dagegen, beide zu nutzen. Ollama als Daemon für Ihre Skripte und Integrationen, LM Studio für interaktive Chats und das Entdecken neuer Modelle. Sie verwenden unterschiedliche Ports (11434 vs. 1234) und kommen sich nicht in die Quere.

#Voraussetzungen

Das Lokale-KI-Paket

LM Studio läuft auf Ihrem Linux-System. Das lokale KI-Kit führt Sie weiter: mit den erweiterten Einstellungen von LM Studio (Kap. 5) und, wenn es einmal hakt, einem Diagnosebaum nach Symptomen — langsamer Betrieb, nicht erkannte Grafikkarte, ein Modell, das alles vergisst (Kap. 14).

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen
Aktuelle Linux-Distribution
Ubuntu 22.04+, Fedora 38+, Debian 12+, Arch oder abgeleitete Distributionen. LM Studio wurde auf den wichtigsten Distributionen getestet, aber die AppImage ist portabel und funktioniert auch anderswo (openSUSE, Linux Mint, Pop!_OS).
glibc 2.35+
Das AppImage enthält seine grafischen Abhängigkeiten, aber nicht die glibc. Wenn Sie eine sehr alte Distribution (CentOS 7, Debian 10) verwenden, läuft es nicht.
FUSE
AppImages verwenden FUSE, um sich zum Lesen einzuhängen. Die meisten Distributionen installieren FUSE standardmäßig. Unter Ubuntu 22.04+ benötigen Sie ausdrücklich das Paket libfuse2.
Mindestens 8 GB RAM
Um ein 7B-Modell in Q4 auszuführen. 16 GB für einen komfortablen Betrieb, 32 GB oder mehr für 14B-Modelle oder um Ihre IDE nebenher geöffnet zu lassen.
GPU (optional, aber empfohlen)
NVIDIA mit aktuellen Treibern (CUDA 12+), AMD mit ROCm 6.x oder Intel Arc über Vulkan. Ohne GPU läuft es auf der CPU – für 3B-Modelle brauchbar, für 7B-Modelle langsam.
!
Ubuntu 22.04 und FUSE
Ubuntu 22.04 enthält libfuse2 nicht mehr standardmäßig, weshalb viele AppImages mit einer kryptischen Meldung wie „dlopen(): error loading libfuse.so.2“ nicht mehr funktionieren. Installieren Sie das Paket mit sudo apt install libfuse2, bevor Sie LM Studio starten.

#1. AppImage herunterladen

Die offizielle Website erkennt Ihr Betriebssystem automatisch und bietet die passende Version an. Stellen Sie sicher, dass Sie tatsächlich von lmstudio.ai herunterladen — es gibt zweifelhafte Mirror-Websites.

Offizielle Website
https://lmstudio.ai
  1. 01
    Laden Sie die .AppImage-Datei herunter
    Die Binärdatei ist zwischen 500 und 700 MB groß. Sie enthält llama.cpp, die Electron-Benutzeroberfläche und die gesamte Laufzeitumgebung. Legen Sie sie der Konvention entsprechend in ~/Applications/ oder ~/.local/bin/ ab – tatsächlich kann sie überall liegen, da das AppImage alle benötigten Komponenten enthält.
  2. 02
    Machen Sie es ausführbar
    Mit dem Befehl chmod +x. Ohne diesen Schritt ist die Datei lediglich ein nicht ausführbares Archiv.
  3. 03
    Lancez-le
    Per Doppelklick im Dateimanager oder über die Kommandozeile. Beim ersten Start entpackt LM Studio seinen Inhalt nach ~/.cache/AppImage/ – das ist normal und wiederholt sich nur bei jeder Aktualisierung.
Schnelle Installation über die CLI
mkdir -p ~/Applications
cd ~/Applications
# Remplacez le nom par celui du fichier téléchargé
chmod +x LM_Studio-*.AppImage
./LM_Studio-*.AppImage
→
LM Studio ins Anwendungsmenü integrieren
Installieren Sie appimaged oder AppImageLauncher: Diese Tools erkennen automatisch die AppImage-Dateien in ~/Applications/ und erstellen die .desktop-Dateien, damit Sie die Anwendungen im Menü sehen, wie native Anwendungen. AppImageLauncher kümmert sich auch um Updates.

#2. Erster Start

Beim ersten Start fordert LM Studio Sie auf, einen Oberflächenmodus auszuwählen: User (nur Chat), Power User (Chat + Einstellungen), Developer (alles, einschließlich Server). Power User reicht zum Erkunden aus; später können Sie unter Settings → UI Mode zu Developer wechseln, um den lokalen Server zu nutzen.

Die linke Seitenleiste organisiert die Ansichten:

Chat
Die Hauptoberfläche, ähnlich wie bei ChatGPT. Diese werden Sie 90 % der Zeit verwenden.
Discover
Modell-Store. Direkte Suche auf Hugging Face mit einem Hardwarekompatibilitätsindikator (Full GPU Offload / Partial / Likely too large) basierend auf der erkannten VRAM.
My Models
Alle heruntergeladenen Modelle mit ihrer Größe und ihren Quantisierungen. Nützlich zum Aufräumen.
Developer
Ein lokal laufender, OpenAI-kompatibler Server. Nur im Power User- oder Developer-Modus sichtbar.

#3. Herunterladen eines GGUF-Modells

LM Studio liest nur das GGUF-Format (das Binärformat von llama.cpp, Nachfolger von GGML). Wenn ein Modell auf Hugging Face verfügbar ist, aber nicht im GGUF-Format, können Sie es nicht direkt laden. Die große Mehrheit der beliebten Modelle (Qwen 3.5, Gemma 4, Mistral, Granite 4.2, DeepSeek, gpt-oss) hat GGUF-Versionen, die von der Community gepflegt werden.

  1. 01
    Öffnen Sie Discover und suchen Sie ein Modell
    Für einen ersten Test geben Sie Qwen 3.5 9B oder Granite 4.2 8B ein — bewährte Optionen für 2026 im Bereich von 6–8 GB VRAM. LM Studio listet die verfügbaren GGUF-Varianten auf, die meist von bartowski, unsloth oder lmstudio-community veröffentlicht werden.
  2. 02
    Lesen Sie die Kompatibilitätskennzeichnungen
    Rechts neben jeder Variante steht ein grüner/oranger/roter Hinweis: „Full GPU Offload“ bedeutet, dass das Modell vollständig in den VRAM passt. „Partial“ = ein Teil wird in den RAM geladen (langsamer). „Likely too large“ = lieber nicht.
  3. 03
    Wählen Sie die Quantisierung
    Q4_K_M ist für die meisten Fälle der beste Kompromiss (geringer Qualitätsverlust, ~50 % der FP16-Größe). Q5_K_M, wenn Sie 30–40 % mehr VRAM haben. Q8_0 für maximale Qualität, wenn Sie reichlich Platz haben. FP16 nur für Fine-Tuning oder Vergleiche.
  4. 04
    Klicken Sie auf Download
    4 bis 8 GB für ein 7B je nach Quantisierung. Das Herunterladen erfolgt im Hintergrund, Sie können mehrere gleichzeitig starten.
→
Wo werden die Modelle gespeichert?
Standardmäßig legt LM Studio die Modelle in ~/.cache/lm-studio/models/ ab. Unter Linux kann dieser Ordner schnell wachsen (50–200 GB mit einigen Modellen). Wenn Ihr /home auf einer kleinen SSD liegt, verschieben Sie den Ordner über Settings → Model Directory auf ein größeres Laufwerk.

Sobald das Modell heruntergeladen ist, kehren Sie zu Chat zurück, wählen Sie es im Dropdown-Menü oben aus, stellen Sie den Schieberegler GPU offload auf den höchsten angebotenen Wert und klicken Sie auf Load model. Das Laden dauert je nach Größe und Geschwindigkeit des Laufwerks 5 bis 30 Sekunden.

#4. Den lokalen Server auf Port 1234 starten

Hier geht LM Studio über einen einfachen Chat mit grafischer Oberfläche hinaus. Der Tab Developer stellt einen HTTP-Server bereit, der genau dasselbe Protokoll wie die OpenAI-API verwendet. Jeder OpenAI-Client (openai-python, LangChain, LlamaIndex, Continue.dev) kann darauf zugreifen, ohne angepasst werden zu müssen – lediglich die Basis-URL muss geändert werden.

  1. 01
    Wechseln Sie in den Developer-Modus
    Settings → UI Mode → Developer. Die Registerkarte Developer (Terminal-Symbol) erscheint in der Seitenleiste.
  2. 02
    Wählen Sie ein Modell aus
    Menü oben im Reiter Developer. Das Modell muss bereits heruntergeladen sein. Sie können mehrere Modelle parallel laden, sofern der VRAM ausreicht.
  3. 03
    Stellen Sie Context Length und GPU Offload ein
    Stellen Sie das GPU-Offloading auf den höchsten Wert, solange der VRAM ausreicht. Die standardmäßige Kontextlänge von 4096 reicht für die meisten Anwendungen; bei RAG oder langen Dokumenten können Sie sie auf 8192 oder 16384 erhöhen.
  4. 04
    Klicken Sie auf Start Server
    Der Server lauscht standardmäßig auf 127.0.0.1:1234. Der Port lässt sich direkt daneben einstellen, falls 1234 bereits belegt ist.
Server testen
# Liste des modèles chargés
curl http://localhost:1234/v1/models

# Une complétion chat minimale
curl http://localhost:1234/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "local-model",
    "messages": [
      {"role":"user","content":"Capitale de l'\''Italie ?"}
    ],
    "temperature": 0.2
  }'

Für Python genügt der offizielle openai-Client. Der API-Schlüssel kann eine beliebige Zeichenfolge sein – LM Studio überprüft ihn nicht.

Python-Client
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:1234/v1",
    api_key="lm-studio",  # placeholder, non vérifié
)

resp = client.chat.completions.create(
    model="local-model",
    messages=[
        {"role": "system", "content": "Tu réponds en une phrase."},
        {"role": "user",   "content": "Qu'est-ce qu'un GGUF ?"},
    ],
    stream=True,
)

for chunk in resp:
    print(chunk.choices[0].delta.content or "", end="", flush=True)
i
Logs in Echtzeit
Der Developer-Tab zeigt die Server-Logs in Echtzeit an: Jede eingehende Anfrage, die Generationszeit, die Anzahl der Tokens. Unverzichtbar zum Debuggen einer Integration.

Um den Server im LAN verfügbar zu machen (für andere Arbeitsplätze des Teams), ändern Sie Host in den Servereinstellungen von 127.0.0.1 auf 0.0.0.0. Achtung: LM Studio verfügt über keine native Authentifizierung. Schalten Sie in einem gemeinsam genutzten Netzwerk Caddy oder Nginx mit Basic Auth vor den Server oder beschränken Sie den Zugriff über die Firewall.

#5. GPU-Beschleunigung unter Linux

Das ist das Thema mit den meisten Fallstricken bei LM Studio unter Linux. Das AppImage enthält mehrere Backends (CPU, CUDA, ROCm, Vulkan) und wählt beim Start automatisch eines aus — doch je nach installierten Treibern liegt die automatische Erkennung manchmal falsch.

NVIDIA (CUDA)
Proprietäre Treiber ab Version 535 installiert (nvidia-smi muss funktionieren). CUDA 12.x ist im AppImage enthalten und muss nicht separat installiert werden. Prüfen Sie unter Settings → Hardware, ob die GPU aufgeführt ist und das Backend tatsächlich CUDA ist.
AMD (ROCm)
ROCm-6.x-Treiber auf dem Host installiert (Radeon RX 6800 XT und neuere Modelle offiziell unterstützt, RX 6700 XT und RX 7600 mit HSA_OVERRIDE_GFX_VERSION oft funktionsfähig). Ihr Benutzerkonto muss den Gruppen render und video angehören.
Intel Arc / iGPU
Vulkan-Backend, ordentliche Leistung auf Arc A770/A750, aber schwächer als bei NVIDIA/AMD. Installieren Sie vulkan-tools, um mit vulkaninfo zu prüfen, ob die GPU erkannt wird.
Keine GPU
Automatischer CPU-Fallback. Für ein Granite 4.2 8B Q4 auf einem Ryzen 7 sollten Sie mit 5–8 Tokens/Sekunde rechnen. Ein 3B-Modell wie Qwen 3.5 2B oder Granite 4.2 3B bleibt sehr gut nutzbar. Oberhalb von 14B wird die Geduld zum Problem.

Der Regler GPU offload in Chat oder Developer bestimmt, wie viele Schichten des Modells auf die GPU geladen werden. Stellen Sie ihn auf den höchstmöglichen Wert, solange der VRAM ausreicht. Überprüfen Sie den tatsächlichen Speicherverbrauch in einem Terminal:

VRAM überwachen
# NVIDIA
nvidia-smi -l 1

# AMD (radeontop ou rocm-smi)
rocm-smi --showmeminfo vram
VRAM-Richtwerte nach Modellgröße (Q4)
3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Diese Werte steigen etwas, wenn Sie die Kontextlänge über 4096 hinaus erhöhen.
GPUs zur Orientierung
Die RTX 3060 mit 12 GB deckt 7B–14B problemlos ab. Die RTX 4070 mit 12 GB: dasselbe mit zusätzlichem Spielraum. Die RTX 4080 mit 16 GB: 14B in Q5, erste 24B-Modelle. Die RTX 4090 mit 24 GB: 32B in Q4, 70B in Q3. Mac M4 Pro mit 24–48 GB Unified Memory: dieselben Möglichkeiten auf Apple Silicon, allerdings über die macOS-Version von LM Studio.
!
Die Falle des unbemerkten CPU-Fallbacks
Wenn der VRAM für das Modell bei der gewünschten Kontextlänge nicht ausreicht, lagert LM Studio einige Schichten in den Arbeitsspeicher aus, ohne dies immer klar anzuzeigen. Sie erhalten 2–5 Tokens pro Sekunde statt über 40. Prüfen Sie während der Generierung Settings → Hardware oder nvidia-smi – wenn der VRAM nicht voll ausgelastet ist, läuft das Modell teilweise auf der CPU.

#Häufige Stolperfallen

Das AppImage startet nicht
Starten Sie die AppImage-Datei über ein Terminal, um die Fehlermeldung zu sehen. Die häufigste Ursache: fehlendes libfuse2 unter Ubuntu 22.04+ (sudo apt install libfuse2 behebt das Problem). Danach: eine zu alte glibc-Version (LM Studio benötigt 2.35+, daher kommen CentOS 7 und Debian 10 nicht infrage).
Die GPU wird nicht genutzt
Prüfen Sie nvidia-smi (oder rocm-smi). Wenn die GPU nicht aufgelistet ist, fehlen die Treiber oder sind zu alt. Wenn sie aufgelistet ist, LM Studio aber weiterhin die CPU nutzt, können Sie unter Settings → Hardware das Backend (CUDA/ROCm/Vulkan) erzwingen. Bei AMD muss der Benutzer Mitglied der Gruppen render und video sein – melden Sie sich nach dem usermod ab und wieder an.
Das Modell ist trotz der GPU langsam
VRAM voll ausgelastet und unbemerkter teilweiser Offload. Reduzieren Sie die Kontextlänge, stellen Sie den GPU-Offload-Regler niedriger, um den Schwellenwert zu ermitteln, oder wählen Sie eine aggressivere Quantisierung (Q5 → Q4 → Q3).
Port 1234 bereits belegt
Häufig von einem anderen Entwicklungsdienst belegt. Ändern Sie den Port unter Developer → Settings oder beenden Sie den Prozess: ss -tulpn | grep 1234. Für die Nutzung über localhost müssen Sie die Firewall nicht ändern.
Automatische Updates, die Probleme verursachen
LM Studio aktualisiert sich standardmäßig automatisch. Deaktivieren Sie dies in kontrollierten Umgebungen (Unternehmen, CI/CD-Integration) über Settings → Updates. Notieren Sie die Versionsnummer der funktionierenden Version, damit Sie bei Bedarf zu ihr zurückkehren können.
Keine CLI-Autocompletion
Das AppImage bietet keine umfangreiche Kommandozeilenschnittstelle. Für anspruchsvolleres Scripting bleibt die HTTP-API des Servers (Port 1234) der saubere Weg. Wenn Sie eine echte Kommandozeilenschnittstelle benötigen, eignen sich llama.cpp oder Ollama besser.

#Weiterführende Informationen

Sie haben LM Studio installiert, ein GGUF-Modell geladen und einen OpenAI-kompatiblen Server gestartet, der läuft. Naheliegende nächste Schritte:

Den API-Server umfassend nutzen
Der Leitfaden „LM Studio in einen API-Server verwandeln“ erläutert Streaming, den parallelen Betrieb mehrerer Modelle, die sichere Bereitstellung im LAN und die Leistungsoptimierung im Detail.
Mit Ollama unter Linux vergleichen
Der Leitfaden „Ollama unter Linux installieren“ behandelt den anderen beliebten Stack, der stärker auf den Betrieb als Daemon oder Server ausgerichtet ist. Für viele ist die Kombination aus Ollama (Daemon) und LM Studio (darauf aufsetzende Client-Oberfläche) ideal.
Die richtige Quantisierung wählen
Der Leitfaden „Quantisierung wählen (Q4, Q5, Q8, FP16)“ vergleicht visuell die tatsächlichen Qualitätsverluste und hilft dabei, Qualität und VRAM-Bedarf gegeneinander abzuwägen. Das ist besonders relevant, wenn man eigene GGUF-Dateien herunterlädt.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.