LM Studio unter Linux: Ubuntu, Debian, Arch, Fedora (2026)
LM Studio unter Linux ist eine etwa 600 MB große AppImage, die eine grafische Oberfläche, einen mit Hugging Face verbundenen Modell-Store, eine llama.cpp-Inferenz-Engine und einen OpenAI-kompatiblen Server bündelt. Keine Systeminstallation, kein Daemon, kein Repository, das hinzugefügt werden muss — eine ausführbare Datei, und das ist alles. Dieser Leitfaden behandelt die Installation, das Herunterladen eines GGUF-Modells, den Start des lokalen Servers und die Linux-spezifischen Stolperfallen (Berechtigungen, FUSE, GPU).
#Warum LM Studio auf Linux
Unter Linux greift man für ein lokales LLM meist zu Ollama: systemd-Daemon, übersichtliche CLI, standardmäßig auf localhost:11434 erreichbar. Für den Serverbetrieb ist das hervorragend. LM Studio verfolgt einen anderen Ansatz — den des Arbeitsplatzrechners mit grafischer Oberfläche.
- Eine umfassende Benutzeroberfläche ohne Terminal
- Chat, Hugging-Face-Modellbrowser, Download-Manager, Sampling-Einstellungen: alles in einer grafischen Oberfläche. Nützlich, wenn Sie schnell mehrere Modelle testen möchten, bevor Sie in den Produktivbetrieb wechseln.
- Ein OpenAI-kompatibler Server mit einem Klick
- Der Tab Developer stellt unter http://localhost:1234/v1 einen Endpunkt bereit, der das OpenAI-Protokoll verwendet. Jedes SDK (openai-python, LangChain, Continue.dev) kann darauf zugreifen, ohne eine einzige Codezeile zu ändern.
- Keine Systeminstallation
- Das AppImage läuft im Benutzerbereich. Kein sudo, kein Paket zu installieren, kein Drittanbieter-Repository. Für Rechner mit Einschränkungen durch die IT-Abteilung oder für ungewöhnliche Distributionen ist das wertvoll.
- Natives GGUF-Format
- LM Studio liest ausschließlich das GGUF-Format (das Format von llama.cpp). Es ist dasselbe Format, das Ollama intern verwendet, daher sind 100 % der beliebten Modelle verfügbar.
#Voraussetzungen
LM Studio läuft auf Ihrem Linux-System. Das lokale KI-Kit führt Sie weiter: mit den erweiterten Einstellungen von LM Studio (Kap. 5) und, wenn es einmal hakt, einem Diagnosebaum nach Symptomen — langsamer Betrieb, nicht erkannte Grafikkarte, ein Modell, das alles vergisst (Kap. 14).
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
- Aktuelle Linux-Distribution
- Ubuntu 22.04+, Fedora 38+, Debian 12+, Arch oder abgeleitete Distributionen. LM Studio wurde auf den wichtigsten Distributionen getestet, aber die AppImage ist portabel und funktioniert auch anderswo (openSUSE, Linux Mint, Pop!_OS).
- glibc 2.35+
- Das AppImage enthält seine grafischen Abhängigkeiten, aber nicht die glibc. Wenn Sie eine sehr alte Distribution (CentOS 7, Debian 10) verwenden, läuft es nicht.
- FUSE
- AppImages verwenden FUSE, um sich zum Lesen einzuhängen. Die meisten Distributionen installieren FUSE standardmäßig. Unter Ubuntu 22.04+ benötigen Sie ausdrücklich das Paket libfuse2.
- Mindestens 8 GB RAM
- Um ein 7B-Modell in Q4 auszuführen. 16 GB für einen komfortablen Betrieb, 32 GB oder mehr für 14B-Modelle oder um Ihre IDE nebenher geöffnet zu lassen.
- GPU (optional, aber empfohlen)
- NVIDIA mit aktuellen Treibern (CUDA 12+), AMD mit ROCm 6.x oder Intel Arc über Vulkan. Ohne GPU läuft es auf der CPU – für 3B-Modelle brauchbar, für 7B-Modelle langsam.
#1. AppImage herunterladen
Die offizielle Website erkennt Ihr Betriebssystem automatisch und bietet die passende Version an. Stellen Sie sicher, dass Sie tatsächlich von lmstudio.ai herunterladen — es gibt zweifelhafte Mirror-Websites.
- 01Laden Sie die .AppImage-Datei herunterDie Binärdatei ist zwischen 500 und 700 MB groß. Sie enthält llama.cpp, die Electron-Benutzeroberfläche und die gesamte Laufzeitumgebung. Legen Sie sie der Konvention entsprechend in ~/Applications/ oder ~/.local/bin/ ab – tatsächlich kann sie überall liegen, da das AppImage alle benötigten Komponenten enthält.
- 02Machen Sie es ausführbarMit dem Befehl chmod +x. Ohne diesen Schritt ist die Datei lediglich ein nicht ausführbares Archiv.
- 03Lancez-lePer Doppelklick im Dateimanager oder über die Kommandozeile. Beim ersten Start entpackt LM Studio seinen Inhalt nach ~/.cache/AppImage/ – das ist normal und wiederholt sich nur bei jeder Aktualisierung.
#2. Erster Start
Beim ersten Start fordert LM Studio Sie auf, einen Oberflächenmodus auszuwählen: User (nur Chat), Power User (Chat + Einstellungen), Developer (alles, einschließlich Server). Power User reicht zum Erkunden aus; später können Sie unter Settings → UI Mode zu Developer wechseln, um den lokalen Server zu nutzen.
Die linke Seitenleiste organisiert die Ansichten:
- Chat
- Die Hauptoberfläche, ähnlich wie bei ChatGPT. Diese werden Sie 90 % der Zeit verwenden.
- Discover
- Modell-Store. Direkte Suche auf Hugging Face mit einem Hardwarekompatibilitätsindikator (Full GPU Offload / Partial / Likely too large) basierend auf der erkannten VRAM.
- My Models
- Alle heruntergeladenen Modelle mit ihrer Größe und ihren Quantisierungen. Nützlich zum Aufräumen.
- Developer
- Ein lokal laufender, OpenAI-kompatibler Server. Nur im Power User- oder Developer-Modus sichtbar.
#3. Herunterladen eines GGUF-Modells
LM Studio liest nur das GGUF-Format (das Binärformat von llama.cpp, Nachfolger von GGML). Wenn ein Modell auf Hugging Face verfügbar ist, aber nicht im GGUF-Format, können Sie es nicht direkt laden. Die große Mehrheit der beliebten Modelle (Qwen 3.5, Gemma 4, Mistral, Granite 4.2, DeepSeek, gpt-oss) hat GGUF-Versionen, die von der Community gepflegt werden.
- 01Öffnen Sie Discover und suchen Sie ein ModellFür einen ersten Test geben Sie Qwen 3.5 9B oder Granite 4.2 8B ein — bewährte Optionen für 2026 im Bereich von 6–8 GB VRAM. LM Studio listet die verfügbaren GGUF-Varianten auf, die meist von bartowski, unsloth oder lmstudio-community veröffentlicht werden.
- 02Lesen Sie die KompatibilitätskennzeichnungenRechts neben jeder Variante steht ein grüner/oranger/roter Hinweis: „Full GPU Offload“ bedeutet, dass das Modell vollständig in den VRAM passt. „Partial“ = ein Teil wird in den RAM geladen (langsamer). „Likely too large“ = lieber nicht.
- 03Wählen Sie die QuantisierungQ4_K_M ist für die meisten Fälle der beste Kompromiss (geringer Qualitätsverlust, ~50 % der FP16-Größe). Q5_K_M, wenn Sie 30–40 % mehr VRAM haben. Q8_0 für maximale Qualität, wenn Sie reichlich Platz haben. FP16 nur für Fine-Tuning oder Vergleiche.
- 04Klicken Sie auf Download4 bis 8 GB für ein 7B je nach Quantisierung. Das Herunterladen erfolgt im Hintergrund, Sie können mehrere gleichzeitig starten.
Sobald das Modell heruntergeladen ist, kehren Sie zu Chat zurück, wählen Sie es im Dropdown-Menü oben aus, stellen Sie den Schieberegler GPU offload auf den höchsten angebotenen Wert und klicken Sie auf Load model. Das Laden dauert je nach Größe und Geschwindigkeit des Laufwerks 5 bis 30 Sekunden.
#4. Den lokalen Server auf Port 1234 starten
Hier geht LM Studio über einen einfachen Chat mit grafischer Oberfläche hinaus. Der Tab Developer stellt einen HTTP-Server bereit, der genau dasselbe Protokoll wie die OpenAI-API verwendet. Jeder OpenAI-Client (openai-python, LangChain, LlamaIndex, Continue.dev) kann darauf zugreifen, ohne angepasst werden zu müssen – lediglich die Basis-URL muss geändert werden.
- 01Wechseln Sie in den Developer-ModusSettings → UI Mode → Developer. Die Registerkarte Developer (Terminal-Symbol) erscheint in der Seitenleiste.
- 02Wählen Sie ein Modell ausMenü oben im Reiter Developer. Das Modell muss bereits heruntergeladen sein. Sie können mehrere Modelle parallel laden, sofern der VRAM ausreicht.
- 03Stellen Sie Context Length und GPU Offload einStellen Sie das GPU-Offloading auf den höchsten Wert, solange der VRAM ausreicht. Die standardmäßige Kontextlänge von 4096 reicht für die meisten Anwendungen; bei RAG oder langen Dokumenten können Sie sie auf 8192 oder 16384 erhöhen.
- 04Klicken Sie auf Start ServerDer Server lauscht standardmäßig auf 127.0.0.1:1234. Der Port lässt sich direkt daneben einstellen, falls 1234 bereits belegt ist.
Für Python genügt der offizielle openai-Client. Der API-Schlüssel kann eine beliebige Zeichenfolge sein – LM Studio überprüft ihn nicht.
Um den Server im LAN verfügbar zu machen (für andere Arbeitsplätze des Teams), ändern Sie Host in den Servereinstellungen von 127.0.0.1 auf 0.0.0.0. Achtung: LM Studio verfügt über keine native Authentifizierung. Schalten Sie in einem gemeinsam genutzten Netzwerk Caddy oder Nginx mit Basic Auth vor den Server oder beschränken Sie den Zugriff über die Firewall.
#5. GPU-Beschleunigung unter Linux
Das ist das Thema mit den meisten Fallstricken bei LM Studio unter Linux. Das AppImage enthält mehrere Backends (CPU, CUDA, ROCm, Vulkan) und wählt beim Start automatisch eines aus — doch je nach installierten Treibern liegt die automatische Erkennung manchmal falsch.
- NVIDIA (CUDA)
- Proprietäre Treiber ab Version 535 installiert (nvidia-smi muss funktionieren). CUDA 12.x ist im AppImage enthalten und muss nicht separat installiert werden. Prüfen Sie unter Settings → Hardware, ob die GPU aufgeführt ist und das Backend tatsächlich CUDA ist.
- AMD (ROCm)
- ROCm-6.x-Treiber auf dem Host installiert (Radeon RX 6800 XT und neuere Modelle offiziell unterstützt, RX 6700 XT und RX 7600 mit HSA_OVERRIDE_GFX_VERSION oft funktionsfähig). Ihr Benutzerkonto muss den Gruppen render und video angehören.
- Intel Arc / iGPU
- Vulkan-Backend, ordentliche Leistung auf Arc A770/A750, aber schwächer als bei NVIDIA/AMD. Installieren Sie vulkan-tools, um mit vulkaninfo zu prüfen, ob die GPU erkannt wird.
- Keine GPU
- Automatischer CPU-Fallback. Für ein Granite 4.2 8B Q4 auf einem Ryzen 7 sollten Sie mit 5–8 Tokens/Sekunde rechnen. Ein 3B-Modell wie Qwen 3.5 2B oder Granite 4.2 3B bleibt sehr gut nutzbar. Oberhalb von 14B wird die Geduld zum Problem.
Der Regler GPU offload in Chat oder Developer bestimmt, wie viele Schichten des Modells auf die GPU geladen werden. Stellen Sie ihn auf den höchstmöglichen Wert, solange der VRAM ausreicht. Überprüfen Sie den tatsächlichen Speicherverbrauch in einem Terminal:
- VRAM-Richtwerte nach Modellgröße (Q4)
- 3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Diese Werte steigen etwas, wenn Sie die Kontextlänge über 4096 hinaus erhöhen.
- GPUs zur Orientierung
- Die RTX 3060 mit 12 GB deckt 7B–14B problemlos ab. Die RTX 4070 mit 12 GB: dasselbe mit zusätzlichem Spielraum. Die RTX 4080 mit 16 GB: 14B in Q5, erste 24B-Modelle. Die RTX 4090 mit 24 GB: 32B in Q4, 70B in Q3. Mac M4 Pro mit 24–48 GB Unified Memory: dieselben Möglichkeiten auf Apple Silicon, allerdings über die macOS-Version von LM Studio.
#Häufige Stolperfallen
- Das AppImage startet nicht
- Starten Sie die AppImage-Datei über ein Terminal, um die Fehlermeldung zu sehen. Die häufigste Ursache: fehlendes libfuse2 unter Ubuntu 22.04+ (sudo apt install libfuse2 behebt das Problem). Danach: eine zu alte glibc-Version (LM Studio benötigt 2.35+, daher kommen CentOS 7 und Debian 10 nicht infrage).
- Die GPU wird nicht genutzt
- Prüfen Sie nvidia-smi (oder rocm-smi). Wenn die GPU nicht aufgelistet ist, fehlen die Treiber oder sind zu alt. Wenn sie aufgelistet ist, LM Studio aber weiterhin die CPU nutzt, können Sie unter Settings → Hardware das Backend (CUDA/ROCm/Vulkan) erzwingen. Bei AMD muss der Benutzer Mitglied der Gruppen render und video sein – melden Sie sich nach dem usermod ab und wieder an.
- Das Modell ist trotz der GPU langsam
- VRAM voll ausgelastet und unbemerkter teilweiser Offload. Reduzieren Sie die Kontextlänge, stellen Sie den GPU-Offload-Regler niedriger, um den Schwellenwert zu ermitteln, oder wählen Sie eine aggressivere Quantisierung (Q5 → Q4 → Q3).
- Port 1234 bereits belegt
- Häufig von einem anderen Entwicklungsdienst belegt. Ändern Sie den Port unter Developer → Settings oder beenden Sie den Prozess: ss -tulpn | grep 1234. Für die Nutzung über localhost müssen Sie die Firewall nicht ändern.
- Automatische Updates, die Probleme verursachen
- LM Studio aktualisiert sich standardmäßig automatisch. Deaktivieren Sie dies in kontrollierten Umgebungen (Unternehmen, CI/CD-Integration) über Settings → Updates. Notieren Sie die Versionsnummer der funktionierenden Version, damit Sie bei Bedarf zu ihr zurückkehren können.
- Keine CLI-Autocompletion
- Das AppImage bietet keine umfangreiche Kommandozeilenschnittstelle. Für anspruchsvolleres Scripting bleibt die HTTP-API des Servers (Port 1234) der saubere Weg. Wenn Sie eine echte Kommandozeilenschnittstelle benötigen, eignen sich llama.cpp oder Ollama besser.
#Weiterführende Informationen
Sie haben LM Studio installiert, ein GGUF-Modell geladen und einen OpenAI-kompatiblen Server gestartet, der läuft. Naheliegende nächste Schritte:
- Den API-Server umfassend nutzen
- Der Leitfaden „LM Studio in einen API-Server verwandeln“ erläutert Streaming, den parallelen Betrieb mehrerer Modelle, die sichere Bereitstellung im LAN und die Leistungsoptimierung im Detail.
- Mit Ollama unter Linux vergleichen
- Der Leitfaden „Ollama unter Linux installieren“ behandelt den anderen beliebten Stack, der stärker auf den Betrieb als Daemon oder Server ausgerichtet ist. Für viele ist die Kombination aus Ollama (Daemon) und LM Studio (darauf aufsetzende Client-Oberfläche) ideal.
- Die richtige Quantisierung wählen
- Der Leitfaden „Quantisierung wählen (Q4, Q5, Q8, FP16)“ vergleicht visuell die tatsächlichen Qualitätsverluste und hilft dabei, Qualität und VRAM-Bedarf gegeneinander abzuwägen. Das ist besonders relevant, wenn man eigene GGUF-Dateien herunterlädt.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.