LM Studio: vollständiger Leitfaden 2026
LM Studio ist eine der einfachsten Möglichkeiten, ein LLM lokal unter Windows, macOS und Linux zu nutzen: eine übersichtliche grafische Oberfläche, integrierte Modellsuche und ein OpenAI-kompatibler Server, der sich mit einem Klick starten lässt. Dieser Leitfaden macht Sie mit der Nutzung von LM Studio auf Französisch vertraut: wo Sie die Sprache umstellen, wie Sie sich in der Oberfläche zurechtfinden, wie Sie hochwertige französischsprachige Modelle finden und welche Einstellungen wirklich zählen (Kontext, Temperatur, Quantisierung).
#Warum LM Studio auf Französisch?
LM Studio erfüllt die wichtigsten Voraussetzungen für den Einstieg: keine Kommandozeile, automatische GPU-Erkennung, Modellverwaltung über die Benutzeroberfläche und ein lokaler OpenAI-kompatibler Server, der sich aus jeder App heraus nutzen lässt. Für ein französischsprachiges Publikum stellen sich immer wieder zwei Fragen: Ist die Benutzeroberfläche auf Französisch verfügbar, und wo findet man Modelle, die auf Französisch korrekt antworten?
Die kurze Antwort: Ja, bei der Benutzeroberfläche (Französisch gehört zu den offiziell unterstützten Sprachen), und ja, bei den Modellen — Mistral Small, Qwen 3.5 / 3.8 und Gemma 4 beherrschen Französisch sehr gut. Bleibt die Frage, welche Modelle Sie je nach verfügbarem VRAM und Ihrem Vorhaben laden sollten.
#1. Die Oberfläche auf Französisch einstellen
Du hast LM Studio vollständig erkundet. Das Kit Lokale KI geht in die Tiefe: LM Studio von A bis Z (Kap. 4), seine erweiterten Einstellungen (Kap. 5) und wann ein französisches Modell einem allgemeinen Modell vorzuziehen ist (Kap. 10).
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
LM Studio startet standardmäßig in der Sprache des Systems. Wenn Ihr Betriebssystem auf Französisch ist, ist dies wahrscheinlich bereits der Fall. Andernfalls dauert der Wechsel nur zehn Sekunden.
- 01Einstellungen öffnenKlicken Sie auf das Zahnradsymbol in der linken unteren Ecke des Hauptfensters oder verwenden Sie die Tastenkombination Ctrl+, (Cmd+, auf macOS).
- 02Abschnitt General → LanguageSuchen Sie im Bereich Settings den Abschnitt General. Das Menü Language listet die verfügbaren Sprachen auf.
- 03Französisch auswählenWählen Sie „Français“ aus der Dropdown-Liste aus. Die Benutzeroberfläche wechselt sofort die Sprache, ohne dass ein Neustart erforderlich ist.
#2. Rundgang durch die Benutzeroberfläche
Nach dem Öffnen bietet LM Studio über die linke Seitenleiste Zugang zu fünf Hauptbereichen. Hier erfahren Sie, wozu die einzelnen Bereiche dienen.
- Chat (Sprechblasen-Symbol)
- Der Hauptbildschirm: Gespräch mit dem geladenen Modell. Modellauswahl oben, Einstellungen rechts, Chatverlauf links.
- Entdecken / Search (Lupensymbol)
- Modelle auf Hugging Face suchen. Filtern nach Architektur, Größe, Format (GGUF, MLX). Hier werden die Modelle heruntergeladen.
- Meine Modelle (Ordner-Icon)
- Liste aller auf Ihren Datenträger heruntergeladenen Modelle mit Dateigröße, Quantisierung und lokalem Pfad. Ermöglicht die Deinstallation, um Speicherplatz freizugeben.
- Lokaler Server (Terminal-Icon)
- Aktiviert einen OpenAI-kompatiblen Endpoint unter http://localhost:1234. Unerlässlich, um Drittanwendungen (VS Code, n8n, Python-Skripte) an LM Studio anzubinden.
- Einstellungen (Zahnradsymbol)
- Sprache, Design, Modellordner, Auswahl des GPU-Backends (CUDA, ROCm, Metal, Vulkan), Entwickleroptionen.
#3. Gute französischsprachige Modelle finden
Die Registerkarte Entdecken fragt Hugging Face direkt ab. Für die Nutzung auf Französisch liefert eine einfache Stichwortsuche durchwachsene Ergebnisse: Viele Modelle geben an, Französisch zu unterstützen, halluzinieren aber, sobald es über einfache Themen hinausgeht. Die Methode, die funktioniert:
- 01Nach vertrauenswürdigem Herausgeber filternGeben Sie mistralai, Qwen oder google in die Suche ein. Diese drei Modellfamilien (Mistral, Qwen 3.5/3.8, Gemma 4) beherrschen Französisch auf muttersprachlichem oder nahezu muttersprachlichem Niveau. Vermeiden Sie anonyme Reuploads — bevorzugen Sie offizielle Konten oder bartowski / lmstudio-community für bereits vorbereitete GGUF-Versionen.
- 02Format prüfenLM Studio liest das GGUF-Format (und MLX auf Apple Silicon). Wenn das Modell nur unkonvertierte safetensors-Gewichte bereitstellt, lässt es sich nicht direkt ausführen. Die Modellkarte gibt dies an.
- 03Eine passende Quantisierung wählenHäufig werden mehrere Dateien angeboten: Q4_K_M, Q5_K_M, Q8_0. Q4_K_M ist der standardmäßig empfohlene Kompromiss. Der Abschnitt zur Quantisierung weiter unten erläutert die Details.
- 04Download startenDer Download-Button befindet sich rechts neben der Datei. Die Leiste unten in der App zeigt den Fortschritt an. Währenddessen können Sie weiterhin ein anderes Modell verwenden.
#4. Empfohlene französischsprachige Modelle
Drei Modellfamilien stechen 2026 für die Nutzung auf Französisch hervor. Die richtige Wahl hängt vor allem von Ihrem verfügbaren VRAM ab.
#Mistral (Französisch auf muttersprachlichem Niveau)
Herausgegeben von Mistral AI, einem französischen Unternehmen. Französisch wird als vollwertige Sprache behandelt, nicht als Zusatzfunktion. 2026 konzentriert sich das Angebot lokal ausführbarer Modelle auf die 24B-Klasse unter der Apache-2.0-Lizenz:
- Mistral Small 24B (Q4_K_M ≈ 14 GB)
- Das französischsprachige Allround-Modell schlechthin, für mindestens 16 GB VRAM. Apache-2.0-Lizenz. Bei komplexen französischen Texten (Verfassen, Zusammenfassen, Schlussfolgern) liegt die Qualität nahe an der eines proprietären Modells.
- Devstral 24B (Q4_K_M ≈ 14 GB)
- Dieselbe Mistral-Basis, spezialisiert auf den Einsatz als Coding-Agent (Apache 2.0). Wenn Sie auf Französisch programmieren, ist das der ideale Begleiter — 16 GB oder mehr VRAM.
Wenn Sie weniger als 16 GB VRAM haben, greifen Sie zu den unten aufgeführten Qwen- oder Gemma-Modellen: Mistral bietet in dieser Größenklasse kein aktuelles kleines Allzweckmodell mehr an.
#Qwen 3.5 / 3.8 (starke mehrsprachige Fähigkeiten)
Von Alibaba veröffentlicht, unter der Apache-2.0-Lizenz. Offiziell auf Dutzenden von Sprachen trainiert, darunter Französisch, mit einer außergewöhnlichen Kohärenz. Diese Familie deckt sämtliche VRAM-Größenklassen am besten ab, vom CPU-Betrieb bis hin zu großen Grafikkarten.
- Qwen 3.5 4B Instruct (Q4_K_M ≈ 3,4 GB)
- Das neue „kleine Standardmodell“. Läuft mit 4–6 GB VRAM oder auf der CPU. Für seine Größe überraschend gut auf Französisch, ideal für Klassifikation und Extraktion.
- Qwen 3.5 9B Instruct (Q4_K_M ≈ 6,6 GB)
- DIE Wahl für 8 GB im Jahr 2026: 256k nativer Kontext und Bildverarbeitung (Vision). Ideal für 8–12 GB VRAM (RTX 3060/4070). Mit Q8_0 (≈ 11 GB) auf einer Karte mit 12 GB steigt die Qualität noch weiter.
- Qwen 3.8 27B Instruct (Q4_K_M ≈ 18 GB)
- Für 24 GB VRAM (RTX 3090/4090). Erschienen am 14.08.2026: 262k Kontext, Bildverarbeitung, von allen Modellen am ähnlichsten zu Copilot. Tipp: Wenn das Modell zu lange nachdenkt, stellen Sie den Reasoning-Level in den Einstellungen auf low.
#Gemma 4 (Google)
Seit Gemma 4 (April 2026) steht die Modellfamilie unter der Apache-2.0-Lizenz und unterstützt Französisch nativ, zusätzlich auch multimodale Eingaben (Text + Bild). Stilistisch ist sie oft „sauberer“ als ältere Llama-Modelle. Drei Größen decken alle Budgets ab: Gemma 4 E2B (Q4 ≈ 4,3 GB) für eine kleine Grafikkarte oder den CPU-Betrieb, das multimodale Gemma 4 12B (Q4 ≈ 7,6 GB) für 8–12 GB VRAM und Gemma 4 26B-A4B (Q4 ≈ 19 GB), ein schnelles multimodales MoE-Modell für 24 GB.
#5. Die Quantisierung erklärt
Alle in LM Studio angezeigten GGUF-Modelle sind quantisiert. Wer versteht, was das bedeutet, vermeidet es, 30 GB umsonst herunterzuladen.
Ein LLM speichert seine Gewichte als Gleitkommazahlen. In der ursprünglichen Version (FP16) belegt jedes Gewicht 2 Bytes – ein 7B-Modell benötigt daher etwa 14 GB. Die Quantisierung verringert die Präzision dieser Gewichte, um den Speicherbedarf zu reduzieren, auf Kosten eines leichten Qualitätsverlusts.
- Q4_K_M (standardmäßig empfohlen)
- Im Durchschnitt 4 Bit pro Gewicht. Reduziert die Größe gegenüber FP16 um etwa den Faktor 4. Minimaler Qualitätsverlust (~1–2 % in Benchmarks). In 90 % der Fälle die vernünftige Wahl.
- Q5_K_M
- 5 Bit pro Gewicht. Etwa 20 % größer als Q4_K_M, die Qualität ist kaum von FP16 zu unterscheiden. Wählen Sie diese Quantisierung, wenn Sie VRAM übrig haben und anspruchsvolle Aufgaben bearbeiten möchten (Code, Verfassen langer Texte).
- Q8_0
- 8 Bit pro Gewicht. In der Qualität nahezu gleichwertig mit FP16, aber 2× größer als Q4_K_M. Relevant für Fine-Tuning oder Referenz-Benchmarks.
- Q3_K_S / Q2_K
- Sehr aggressive Quantisierungen. Sichtbare Qualitätsverluste bei komplexen Aufgaben. Nur für Fälle, in denen Sie ein großes Modell unbedingt in wenig VRAM unterbringen müssen.
- FP16 (nicht quantisiert)
- Native Präzision. 2 Bytes pro Gewicht. Zu vermeiden, es sei denn, Sie haben genügend VRAM und maximale Qualität ist entscheidend.
#6. Kontext und Temperatur
Im rechten Bereich des Chats haben zwei Einstellungen eine deutlich größere spürbare Wirkung als alle anderen.
#Context Length (Länge des Kontexts)
Wie viele Tokens das Modell gleichzeitig „sehen“ kann – Ihren Prompt, den Chatverlauf und die Antwort. LM Studio stellt standardmäßig 2048 oder 4096 ein, was wenig ist: Eine etwas umfangreichere Unterhaltung oder ein eingefügtes Dokument überschreitet diese Grenze schnell, und das Modell vergisst den Anfang.
- Kurze Gespräche (allgemeiner Assistent)
- 4096 Tokens reichen aus. Das spart VRAM und verursacht keine Verlangsamung.
- Dokumentanalyse (Zusammenfassung, Fragen und Antworten)
- 16k bis 32k. Prüfen Sie, ob das Modell diesen Kontext nativ unterstützt (Qwen 3.5 9B: 256k, Qwen 3.8 27B: 262k, Granite 4.2 8B: 128k).
- Code und lange Berichte
- 32k+. Der VRAM-Verbrauch steigt schnell – bei einem 7B-Modell typischerweise um 3 bis 4 GB zwischen 4k und 32k.
#Temperatur
Steuert die Zufälligkeit der Antworten. Je höher sie ist, desto mehr Risiken geht das Modell bei der Wahl des nächsten Wortes ein; je niedriger sie ist, desto stärker hält es sich an das wahrscheinlichste Wort.
- 0,0 – 0,3 (deterministisch)
- Für Datenextraktion, Klassifizierung, Programmierung oder jede Aufgabe, bei der Sie jedes Mal dieselbe Antwort erhalten möchten. Das Modell kann trocken wirken oder sich wiederholen.
- 0,4 – 0,7 (ausgewogen, Standard)
- Für allgemeine Assistenten, Fragen und Antworten sowie Zusammenfassungen. Gute Mischung aus Kohärenz und Vielfalt. LM Studio startet häufig mit einem Wert von 0,7.
- 0,8 – 1,2 (kreativ)
- Für freies Schreiben, Brainstorming und Fiktion. Das Modell nimmt sich mehr stilistische Freiheiten. Bei Werten über 1,2 werden die Ausgaben schnell inkohärent.
#Tipps und Stolperfallen
- Das Modell antwortet auf Englisch statt auf Französisch
- Fügen Sie einen expliziten Systemprompt hinzu: „Du antwortest ausschließlich auf Französisch, auch wenn die Frage auf Englisch gestellt wird.“ Modelle, die nicht von Mistral stammen, benötigen dies manchmal.
- Unterbrochene Downloads
- LM Studio setzt unterbrochene Downloads nicht immer korrekt fort. Wenn ein Download hängen bleibt, löschen Sie die unvollständige Datei unter Mes modèles und starten Sie den Download erneut. Verwenden Sie für große Modelle (> 10 GB) möglichst eine stabile Verbindung.
- Ein Modell entladen, um VRAM freizugeben
- Die Schaltfläche Eject oben im Chat entlädt das Modell. Praktisch, bevor Sie ein anderes GPU-intensives Programm starten (Spiel, Video-Rendering).
- Mehrere Chats parallel
- Jeder Chat behält seinen eigenen Verlauf und seine eigenen Einstellungen. Nützlich, um zwei Modelle bei derselben Frage nebeneinander zu vergleichen.
- System-Prompt pro Modell
- Der im rechten Bedienfeld konfigurierte Systemprompt wird mit der Konversation gespeichert, nicht mit dem Modell. Für ein dauerhaftes Verhalten erstellen Sie ein Preset (Schaltfläche Save Preset).
- MLX-Modelle für Mac
- Auf Apple Silicon bietet LM Studio MLX-Versionen sowie GGUF-Modelle an. Bei gleicher Größe ist MLX schneller. Mistral und Qwen verfügen über offizielle MLX-Versionen.
#Weiterführende Informationen
Sie haben LM Studio auf Französisch eingerichtet und wissen, wie Sie ein französischsprachiges Modell auswählen und die wichtigen Parameter einstellen. Die nächsten naheliegenden Schritte:
- Lokalen Server aktivieren
- Der Leitfaden „LM Studio in einen API-Server verwandeln“ beschreibt ausführlich, wie Sie den OpenAI-kompatiblen Endpunkt unter http://localhost:1234 bereitstellen und mit VS Code, n8n oder einem Python-Skript verbinden.
- Mit Ollama vergleichen
- Die Anleitung Ollama vs LM Studio vs Jan vs GPT4All vergleicht die GUI/CLI-Tools. Viele kombinieren Ollama (Daemon) + LM Studio (Client-Interface), um von den Vorteilen beider zu profitieren.
- Mehr über Quantisierung erfahren
- Der Leitfaden „Die passende Quantisierung wählen (Q4, Q5, Q8, FP16)“ vergleicht anschaulich die tatsächlichen Qualitätsverluste je nach Aufgabe.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.