Einsteiger 8 minFranzösisch

LM Studio: vollständiger Leitfaden 2026

LM Studio ist eine der einfachsten Möglichkeiten, ein LLM lokal unter Windows, macOS und Linux zu nutzen: eine übersichtliche grafische Oberfläche, integrierte Modellsuche und ein OpenAI-kompatibler Server, der sich mit einem Klick starten lässt. Dieser Leitfaden macht Sie mit der Nutzung von LM Studio auf Französisch vertraut: wo Sie die Sprache umstellen, wie Sie sich in der Oberfläche zurechtfinden, wie Sie hochwertige französischsprachige Modelle finden und welche Einstellungen wirklich zählen (Kontext, Temperatur, Quantisierung).

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum LM Studio auf Französisch?

LM Studio erfüllt die wichtigsten Voraussetzungen für den Einstieg: keine Kommandozeile, automatische GPU-Erkennung, Modellverwaltung über die Benutzeroberfläche und ein lokaler OpenAI-kompatibler Server, der sich aus jeder App heraus nutzen lässt. Für ein französischsprachiges Publikum stellen sich immer wieder zwei Fragen: Ist die Benutzeroberfläche auf Französisch verfügbar, und wo findet man Modelle, die auf Französisch korrekt antworten?

Die kurze Antwort: Ja, bei der Benutzeroberfläche (Französisch gehört zu den offiziell unterstützten Sprachen), und ja, bei den Modellen — Mistral Small, Qwen 3.5 / 3.8 und Gemma 4 beherrschen Französisch sehr gut. Bleibt die Frage, welche Modelle Sie je nach verfügbarem VRAM und Ihrem Vorhaben laden sollten.

i
Was dieser Leitfaden abdeckt
Erste Schritte mit LM Studio auf einem Rechner, auf dem es bereits installiert ist. Wenn Sie es noch nicht installiert haben, finden Sie die Installation in den Anleitungen „Erste Schritte mit LM Studio (Windows/macOS)“ oder „LM Studio unter Linux“. Hier konzentrieren wir uns auf die Nutzung auf Französisch.

#1. Die Oberfläche auf Französisch einstellen

Das Kit Lokale KI

Du hast LM Studio vollständig erkundet. Das Kit Lokale KI geht in die Tiefe: LM Studio von A bis Z (Kap. 4), seine erweiterten Einstellungen (Kap. 5) und wann ein französisches Modell einem allgemeinen Modell vorzuziehen ist (Kap. 10).

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

LM Studio startet standardmäßig in der Sprache des Systems. Wenn Ihr Betriebssystem auf Französisch ist, ist dies wahrscheinlich bereits der Fall. Andernfalls dauert der Wechsel nur zehn Sekunden.

  1. 01
    Einstellungen öffnen
    Klicken Sie auf das Zahnradsymbol in der linken unteren Ecke des Hauptfensters oder verwenden Sie die Tastenkombination Ctrl+, (Cmd+, auf macOS).
  2. 02
    Abschnitt General → Language
    Suchen Sie im Bereich Settings den Abschnitt General. Das Menü Language listet die verfügbaren Sprachen auf.
  3. 03
    Französisch auswählen
    Wählen Sie „Français“ aus der Dropdown-Liste aus. Die Benutzeroberfläche wechselt sofort die Sprache, ohne dass ein Neustart erforderlich ist.
→
Teilweise Übersetzung
Einige sehr technische Bezeichnungen (Architekturnamen, erweiterte Sampler-Parameter) bleiben auch im französischen Modus auf Englisch. Das ist beabsichtigt: Diese Begriffe sind in der gesamten LLM-Community gebräuchlich, und es ist besser, sie in ihrer ursprünglichen Form wiederzuerkennen.

#2. Rundgang durch die Benutzeroberfläche

Nach dem Öffnen bietet LM Studio über die linke Seitenleiste Zugang zu fünf Hauptbereichen. Hier erfahren Sie, wozu die einzelnen Bereiche dienen.

Chat (Sprechblasen-Symbol)
Der Hauptbildschirm: Gespräch mit dem geladenen Modell. Modellauswahl oben, Einstellungen rechts, Chatverlauf links.
Entdecken / Search (Lupensymbol)
Modelle auf Hugging Face suchen. Filtern nach Architektur, Größe, Format (GGUF, MLX). Hier werden die Modelle heruntergeladen.
Meine Modelle (Ordner-Icon)
Liste aller auf Ihren Datenträger heruntergeladenen Modelle mit Dateigröße, Quantisierung und lokalem Pfad. Ermöglicht die Deinstallation, um Speicherplatz freizugeben.
Lokaler Server (Terminal-Icon)
Aktiviert einen OpenAI-kompatiblen Endpoint unter http://localhost:1234. Unerlässlich, um Drittanwendungen (VS Code, n8n, Python-Skripte) an LM Studio anzubinden.
Einstellungen (Zahnradsymbol)
Sprache, Design, Modellordner, Auswahl des GPU-Backends (CUDA, ROCm, Metal, Vulkan), Entwickleroptionen.
i
Das rechte Bedienfeld im Chat
Während eines Gesprächs zeigt der rechte Seitenbereich die Modellparameter an (System-Prompt, Temperatur, top-p, Kontextlänge usw.). Hier wird das Verhalten tatsächlich eingestellt, nicht in den globalen Settings.

#3. Gute französischsprachige Modelle finden

Die Registerkarte Entdecken fragt Hugging Face direkt ab. Für die Nutzung auf Französisch liefert eine einfache Stichwortsuche durchwachsene Ergebnisse: Viele Modelle geben an, Französisch zu unterstützen, halluzinieren aber, sobald es über einfache Themen hinausgeht. Die Methode, die funktioniert:

  1. 01
    Nach vertrauenswürdigem Herausgeber filtern
    Geben Sie mistralai, Qwen oder google in die Suche ein. Diese drei Modellfamilien (Mistral, Qwen 3.5/3.8, Gemma 4) beherrschen Französisch auf muttersprachlichem oder nahezu muttersprachlichem Niveau. Vermeiden Sie anonyme Reuploads — bevorzugen Sie offizielle Konten oder bartowski / lmstudio-community für bereits vorbereitete GGUF-Versionen.
  2. 02
    Format prüfen
    LM Studio liest das GGUF-Format (und MLX auf Apple Silicon). Wenn das Modell nur unkonvertierte safetensors-Gewichte bereitstellt, lässt es sich nicht direkt ausführen. Die Modellkarte gibt dies an.
  3. 03
    Eine passende Quantisierung wählen
    Häufig werden mehrere Dateien angeboten: Q4_K_M, Q5_K_M, Q8_0. Q4_K_M ist der standardmäßig empfohlene Kompromiss. Der Abschnitt zur Quantisierung weiter unten erläutert die Details.
  4. 04
    Download starten
    Der Download-Button befindet sich rechts neben der Datei. Die Leiste unten in der App zeigt den Fortschritt an. Währenddessen können Sie weiterhin ein anderes Modell verwenden.
!
Vorsicht bei der angezeigten VRAM-Angabe
LM Studio zeigt mit einem grünen/gelben/roten Punkt an, ob ein Modell in den VRAM passt. Diese Schätzung berücksichtigt nicht immer die Kontextlänge, die Sie verwenden möchten. Ein Modell, das bei 4096 Tokens grün angezeigt wird, kann bei 32k rot angezeigt werden. Prüfen Sie dies nach dem Laden mit ollama-style nvidia-smi.

#4. Empfohlene französischsprachige Modelle

Drei Modellfamilien stechen 2026 für die Nutzung auf Französisch hervor. Die richtige Wahl hängt vor allem von Ihrem verfügbaren VRAM ab.

#Mistral (Französisch auf muttersprachlichem Niveau)

Herausgegeben von Mistral AI, einem französischen Unternehmen. Französisch wird als vollwertige Sprache behandelt, nicht als Zusatzfunktion. 2026 konzentriert sich das Angebot lokal ausführbarer Modelle auf die 24B-Klasse unter der Apache-2.0-Lizenz:

Mistral Small 24B (Q4_K_M ≈ 14 GB)
Das französischsprachige Allround-Modell schlechthin, für mindestens 16 GB VRAM. Apache-2.0-Lizenz. Bei komplexen französischen Texten (Verfassen, Zusammenfassen, Schlussfolgern) liegt die Qualität nahe an der eines proprietären Modells.
Devstral 24B (Q4_K_M ≈ 14 GB)
Dieselbe Mistral-Basis, spezialisiert auf den Einsatz als Coding-Agent (Apache 2.0). Wenn Sie auf Französisch programmieren, ist das der ideale Begleiter — 16 GB oder mehr VRAM.

Wenn Sie weniger als 16 GB VRAM haben, greifen Sie zu den unten aufgeführten Qwen- oder Gemma-Modellen: Mistral bietet in dieser Größenklasse kein aktuelles kleines Allzweckmodell mehr an.

#Qwen 3.5 / 3.8 (starke mehrsprachige Fähigkeiten)

Von Alibaba veröffentlicht, unter der Apache-2.0-Lizenz. Offiziell auf Dutzenden von Sprachen trainiert, darunter Französisch, mit einer außergewöhnlichen Kohärenz. Diese Familie deckt sämtliche VRAM-Größenklassen am besten ab, vom CPU-Betrieb bis hin zu großen Grafikkarten.

Qwen 3.5 4B Instruct (Q4_K_M ≈ 3,4 GB)
Das neue „kleine Standardmodell“. Läuft mit 4–6 GB VRAM oder auf der CPU. Für seine Größe überraschend gut auf Französisch, ideal für Klassifikation und Extraktion.
Qwen 3.5 9B Instruct (Q4_K_M ≈ 6,6 GB)
DIE Wahl für 8 GB im Jahr 2026: 256k nativer Kontext und Bildverarbeitung (Vision). Ideal für 8–12 GB VRAM (RTX 3060/4070). Mit Q8_0 (≈ 11 GB) auf einer Karte mit 12 GB steigt die Qualität noch weiter.
Qwen 3.8 27B Instruct (Q4_K_M ≈ 18 GB)
Für 24 GB VRAM (RTX 3090/4090). Erschienen am 14.08.2026: 262k Kontext, Bildverarbeitung, von allen Modellen am ähnlichsten zu Copilot. Tipp: Wenn das Modell zu lange nachdenkt, stellen Sie den Reasoning-Level in den Einstellungen auf low.

#Gemma 4 (Google)

Seit Gemma 4 (April 2026) steht die Modellfamilie unter der Apache-2.0-Lizenz und unterstützt Französisch nativ, zusätzlich auch multimodale Eingaben (Text + Bild). Stilistisch ist sie oft „sauberer“ als ältere Llama-Modelle. Drei Größen decken alle Budgets ab: Gemma 4 E2B (Q4 ≈ 4,3 GB) für eine kleine Grafikkarte oder den CPU-Betrieb, das multimodale Gemma 4 12B (Q4 ≈ 7,6 GB) für 8–12 GB VRAM und Gemma 4 26B-A4B (Q4 ≈ 19 GB), ein schnelles multimodales MoE-Modell für 24 GB.

→
Vor dem Einsatz testen
Laden Sie 2–3 Kandidaten herunter und stellen Sie ihnen dieselben technischen Fragen aus Ihrem Fachgebiet auf Französisch (Fachvokabular, französische Abkürzungen, schwierige grammatische Kongruenzfälle). In 10 Minuten wissen Sie, welches Modell Ihrem tatsächlichen Bedarf entspricht — ein kleineres Modell, das richtig antwortet und VRAM spart, ist mehr wert als ein großes, das zögert.

#5. Die Quantisierung erklärt

Alle in LM Studio angezeigten GGUF-Modelle sind quantisiert. Wer versteht, was das bedeutet, vermeidet es, 30 GB umsonst herunterzuladen.

Ein LLM speichert seine Gewichte als Gleitkommazahlen. In der ursprünglichen Version (FP16) belegt jedes Gewicht 2 Bytes – ein 7B-Modell benötigt daher etwa 14 GB. Die Quantisierung verringert die Präzision dieser Gewichte, um den Speicherbedarf zu reduzieren, auf Kosten eines leichten Qualitätsverlusts.

Q4_K_M (standardmäßig empfohlen)
Im Durchschnitt 4 Bit pro Gewicht. Reduziert die Größe gegenüber FP16 um etwa den Faktor 4. Minimaler Qualitätsverlust (~1–2 % in Benchmarks). In 90 % der Fälle die vernünftige Wahl.
Q5_K_M
5 Bit pro Gewicht. Etwa 20 % größer als Q4_K_M, die Qualität ist kaum von FP16 zu unterscheiden. Wählen Sie diese Quantisierung, wenn Sie VRAM übrig haben und anspruchsvolle Aufgaben bearbeiten möchten (Code, Verfassen langer Texte).
Q8_0
8 Bit pro Gewicht. In der Qualität nahezu gleichwertig mit FP16, aber 2× größer als Q4_K_M. Relevant für Fine-Tuning oder Referenz-Benchmarks.
Q3_K_S / Q2_K
Sehr aggressive Quantisierungen. Sichtbare Qualitätsverluste bei komplexen Aufgaben. Nur für Fälle, in denen Sie ein großes Modell unbedingt in wenig VRAM unterbringen müssen.
FP16 (nicht quantisiert)
Native Präzision. 2 Bytes pro Gewicht. Zu vermeiden, es sei denn, Sie haben genügend VRAM und maximale Qualität ist entscheidend.
i
VRAM-Richtwerte nach Modellgröße (Q4)
3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Rechnen Sie für jede zusätzliche Kontextspanne von 8k Tokens oberhalb von 4096 Tokens mit ~1 GB mehr.

#6. Kontext und Temperatur

Im rechten Bereich des Chats haben zwei Einstellungen eine deutlich größere spürbare Wirkung als alle anderen.

#Context Length (Länge des Kontexts)

Wie viele Tokens das Modell gleichzeitig „sehen“ kann – Ihren Prompt, den Chatverlauf und die Antwort. LM Studio stellt standardmäßig 2048 oder 4096 ein, was wenig ist: Eine etwas umfangreichere Unterhaltung oder ein eingefügtes Dokument überschreitet diese Grenze schnell, und das Modell vergisst den Anfang.

Kurze Gespräche (allgemeiner Assistent)
4096 Tokens reichen aus. Das spart VRAM und verursacht keine Verlangsamung.
Dokumentanalyse (Zusammenfassung, Fragen und Antworten)
16k bis 32k. Prüfen Sie, ob das Modell diesen Kontext nativ unterstützt (Qwen 3.5 9B: 256k, Qwen 3.8 27B: 262k, Granite 4.2 8B: 128k).
Code und lange Berichte
32k+. Der VRAM-Verbrauch steigt schnell – bei einem 7B-Modell typischerweise um 3 bis 4 GB zwischen 4k und 32k.

#Temperatur

Steuert die Zufälligkeit der Antworten. Je höher sie ist, desto mehr Risiken geht das Modell bei der Wahl des nächsten Wortes ein; je niedriger sie ist, desto stärker hält es sich an das wahrscheinlichste Wort.

0,0 – 0,3 (deterministisch)
Für Datenextraktion, Klassifizierung, Programmierung oder jede Aufgabe, bei der Sie jedes Mal dieselbe Antwort erhalten möchten. Das Modell kann trocken wirken oder sich wiederholen.
0,4 – 0,7 (ausgewogen, Standard)
Für allgemeine Assistenten, Fragen und Antworten sowie Zusammenfassungen. Gute Mischung aus Kohärenz und Vielfalt. LM Studio startet häufig mit einem Wert von 0,7.
0,8 – 1,2 (kreativ)
Für freies Schreiben, Brainstorming und Fiktion. Das Modell nimmt sich mehr stilistische Freiheiten. Bei Werten über 1,2 werden die Ausgaben schnell inkohärent.
→
Top-p anstatt Top-k
Wenn Sie die erweiterten Einstellungen verändern, ist top-p (etwa 0,9) moderner und stabiler als top-k. Lassen Sie die anderen Einstellungen (frequency penalty, presence penalty) auf ihren Standardwerten, sofern Sie keinen speziellen Bedarf haben – sie lösen selten ein echtes Problem und verursachen oft seltsame Nebeneffekte.

#Tipps und Stolperfallen

Das Modell antwortet auf Englisch statt auf Französisch
Fügen Sie einen expliziten Systemprompt hinzu: „Du antwortest ausschließlich auf Französisch, auch wenn die Frage auf Englisch gestellt wird.“ Modelle, die nicht von Mistral stammen, benötigen dies manchmal.
Unterbrochene Downloads
LM Studio setzt unterbrochene Downloads nicht immer korrekt fort. Wenn ein Download hängen bleibt, löschen Sie die unvollständige Datei unter Mes modèles und starten Sie den Download erneut. Verwenden Sie für große Modelle (> 10 GB) möglichst eine stabile Verbindung.
Ein Modell entladen, um VRAM freizugeben
Die Schaltfläche Eject oben im Chat entlädt das Modell. Praktisch, bevor Sie ein anderes GPU-intensives Programm starten (Spiel, Video-Rendering).
Mehrere Chats parallel
Jeder Chat behält seinen eigenen Verlauf und seine eigenen Einstellungen. Nützlich, um zwei Modelle bei derselben Frage nebeneinander zu vergleichen.
System-Prompt pro Modell
Der im rechten Bedienfeld konfigurierte Systemprompt wird mit der Konversation gespeichert, nicht mit dem Modell. Für ein dauerhaftes Verhalten erstellen Sie ein Preset (Schaltfläche Save Preset).
MLX-Modelle für Mac
Auf Apple Silicon bietet LM Studio MLX-Versionen sowie GGUF-Modelle an. Bei gleicher Größe ist MLX schneller. Mistral und Qwen verfügen über offizielle MLX-Versionen.

#Weiterführende Informationen

Sie haben LM Studio auf Französisch eingerichtet und wissen, wie Sie ein französischsprachiges Modell auswählen und die wichtigen Parameter einstellen. Die nächsten naheliegenden Schritte:

Lokalen Server aktivieren
Der Leitfaden „LM Studio in einen API-Server verwandeln“ beschreibt ausführlich, wie Sie den OpenAI-kompatiblen Endpunkt unter http://localhost:1234 bereitstellen und mit VS Code, n8n oder einem Python-Skript verbinden.
Mit Ollama vergleichen
Die Anleitung Ollama vs LM Studio vs Jan vs GPT4All vergleicht die GUI/CLI-Tools. Viele kombinieren Ollama (Daemon) + LM Studio (Client-Interface), um von den Vorteilen beider zu profitieren.
Mehr über Quantisierung erfahren
Der Leitfaden „Die passende Quantisierung wählen (Q4, Q5, Q8, FP16)“ vergleicht anschaulich die tatsächlichen Qualitätsverluste je nach Aufgabe.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.