Einsteiger 11 Min.Oberflächen

Msty: die elegante Oberfläche für lokale LLMs (Mac, Windows, Linux)

Msty ist eine Desktop-App, die beim lokalen Ausführen von LLMs ganz auf die Benutzererfahrung setzt. Während Open WebUI Docker erfordert und LM Studio sich auf die Engine konzentriert, bietet Msty mit einem einzigen Installationsprogramm: ein lokales Modell, Cloud-Modelle (OpenAI, Claude, Gemini) nebeneinander, integriertes RAG über die Knowledge Stacks, Workspaces und Split Chat zum Vergleich zweier Modelle. Dieser Leitfaden zeigt, wie Sie Msty auf Mac, Windows und Linux installieren und für den ernsthaften Einsatz lokaler LLMs nutzen.

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum Msty

Msty (msty.app) richtet sich an eine bestimmte Zielgruppe: Menschen, die eine übersichtlich gestaltete grafische App ohne Docker und ohne CLI möchten, aber mit echten Funktionen über einen einfachen Chat hinaus. Drei Alleinstellungsmerkmale bringen das Tool auf den Punkt.

Alles in einer einzigen App
Integrierte Inferenz-Engine (auf Basis von llama.cpp), ein Client für Ollama, falls Sie es bereits installiert haben, und Cloud-Konnektoren – Sie müssen keinen Stack selbst zusammenstellen.
Knowledge Stacks
RAG ist nativ integriert und erfordert keinen Code. PDFs, Markdown-Dateien, ganze Ordner oder sogar URLs lassen sich per Drag-and-Drop hinzufügen. Msty übernimmt das Chunking, die Embeddings und das Retrieval.
Workspaces und Split Chat
Mehrere isolierte Arbeitsbereiche (privat, beruflich, Forschung und Entwicklung) und die Möglichkeit, dieselbe Frage parallel an 2 bis 4 Modelle in derselben Ansicht zu stellen.
i
Geschäftsmodell
Msty ist Freemium. Die kostenlose Version deckt die große Mehrheit der Anwendungsfälle ab (lokaler Chat, Cloud, grundlegende Knowledge Stacks, Split-Chat mit 2 Modellen). Die Aurum-Version (kostenpflichtig) schaltet unbegrenzten Split-Chat, eine erweiterte Prompt-Bibliothek und einige Pro-Optionen frei. Laut den Richtlinien des Anbieters werden in keiner der beiden Versionen Telemetriedaten zu Ihren Gesprächen erhoben.

#Voraussetzungen

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen
OS
macOS 11+ (Apple Silicon oder Intel), Windows 10/11 (x64), Linux x64 (AppImage und Pakete .deb/.rpm)
Minimale RAM-Anforderung
8 GB für ein 3B-Modell in Q4_K_M, 16 GB für 7B, 32 GB für einen komfortablen Betrieb von 14B, 64 GB, wenn Sie 32B anstreben.
GPU
Optional, aber empfohlen. NVIDIA mit CUDA, AMD mit ROCm/Vulkan, Apple Silicon mit Metal — Msty erkennt und nutzt die GPU automatisch.
Speicher
Je nach Anzahl der Modelle 10–50 GB einplanen. GGUF-Dateien in Q4 reichen von 2 GB (3B) bis 40 GB (70B).
→
VRAM-Bedarf bei Q4 nach Modellgröße
Bei Q4_K_M-Quantisierung (Standard in Msty): 3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Reicht Ihr VRAM nicht aus, lagert Msty in den System-RAM aus — nutzbar, aber langsam (Abfall von 50 auf 5 Tokens/Sekunde).

#1. Installation

Msty lässt sich ausschließlich von der offiziellen Website herunterladen. Derzeit gibt es keine Installation über Paketmanager (weder Homebrew noch winget), was die Überprüfung der Downloadquelle vereinfacht.

Offizielle Website
https://msty.app
!
Laden Sie nur von msty.app herunter
Der Softwarehersteller (Sapling Inc.) signiert nicht über die offiziellen App-Stores. Prüfen Sie die URL sorgfältig – Websites von Drittanbietern verbreiten manchmal modifizierte Versionen weiter. Die offizielle Website ist msty.app, nicht msty.io oder eine andere Variante.
  1. 01
    Installationsdatei herunterladen
    Besuchen Sie msty.app und wählen Sie Ihr Betriebssystem aus. Drei Varianten werden angeboten: Online (abgespeckt, nur für die Cloud), Local (empfohlen, enthält die Inferenz-Engine) und Local + GPU (mit gebündelten CUDA-Treibern für Windows).
  2. 02
    Installieren (Mac)
    Öffnen Sie die .dmg-Datei, ziehen Sie Msty in den Ordner Applications und starten Sie die App beim ersten Mal per Rechtsklick → Öffnen (Gatekeeper). macOS verlangt eine Bestätigung, da die App nicht vom App Store notarisiert ist.
  3. 03
    Installieren (Windows)
    Starten Sie die .exe-Datei. Wählen Sie die GPU-Version, wenn Sie eine aktuelle NVIDIA-Karte besitzen — sie enthält die CUDA-Runtimes und erspart Ihnen das manuelle Herumbasteln an den Treibern. Andernfalls reicht die Version Local CPU/Vulkan aus.
  4. 04
    Installieren (Linux)
    AppImage: chmod +x Msty-*.AppImage und dann ./Msty-*.AppImage. .deb: sudo dpkg -i msty_*.deb. .rpm: sudo rpm -i msty-*.rpm. Bei AppImage kann libfuse2 je nach Distribution erforderlich sein.
  5. 05
    Erster Start
    Msty erstellt sein Datenverzeichnis (~/Library/Application Support/Msty auf dem Mac, %APPDATA%\Msty unter Windows, ~/.config/Msty unter Linux). Dort werden Modelle, Unterhaltungen und Knowledge Stacks gespeichert.

#2. Erstes lokales Modell

Msty bietet eine Einführung, bei der Sie mit einem Klick ein kleines Einstiegsmodell herunterladen können. Sie können auch direkt aus dem Katalog wählen. Drei gute Optionen für Französisch zum Einstieg, je nach Ihrer Hardware:

Kleine Konfiguration (8 GB RAM, ohne GPU)
Qwen 3.5 2B Q4_K_M (≈1,9 GB) oder Granite 4.2 3B (≈2,2 GB). Auch im reinen CPU-Betrieb nutzbar, ideal für Gespräche, Brainstorming und die Zusammenfassung kurzer Texte.
Standardkonfiguration (16 GB RAM, GPU 6–8 GB)
Qwen 3.5 9B Q4_K_M (≈6,6 GB), mit 256k Kontext und Bildverarbeitung. Der beste vielseitige Kompromiss für Französisch und Englisch im Alltag.
Komfortkonfiguration (32 GB RAM, GPU 12–24 GB)
Mistral Small 24B (≈14 GB) oder Qwen 3.8 27B in Q4_K_M (≈18 GB). Deutlich bessere Fähigkeit zum logischen Schlussfolgern, das Nutzungserlebnis nähert sich dem von Cloud-Modellen an.

Zum Herunterladen öffnen Sie die Registerkarte Local AI Models in der linken Seitenleiste und klicken anschließend auf Browse and Download Online Model. Msty verweist auf Hugging Face und filtert nach kompatiblen GGUF-Versionen. Der Fortschritt wird angezeigt; sobald der Download abgeschlossen ist, lässt sich das Modell auswählen.

→
Ihre Ollama-Modelle wiederverwenden
Wenn Sie Ollama bereits auf Ihrem Rechner installiert haben, erkennt Msty die vorhandenen Modelle automatisch und macht sie über seine Oberfläche nutzbar – ohne die Dateien zu duplizieren. Das bietet einen unaufdringlichen Einstieg für einen sanften Wechsel von der Ollama-CLI zu einer vollwertigen grafischen Benutzeroberfläche.

#3. Cloud + lokal parallel

Das ist eine der Stärken von Msty: Sie können Ihre Cloud-API-Schlüssel hinzufügen (OpenAI, Anthropic, Google, OpenRouter, Groq, Mistral Cloud usw.) und diese Modelle in derselben Benutzeroberfläche wie Ihre lokalen Modelle nutzen. Für eine neue Unterhaltung wählen Sie das Modell über ein einfaches Dropdown-Menü aus, das beide Welten zusammenführt.

  1. 01
    Einen Cloud-Anbieter hinzufügen
    Settings → Remote Model Providers → Add. Fügen Sie Ihren API-Schlüssel ein. Msty speichert den Schlüssel lokal (verschlüsselt durch den Schlüsselbund des Betriebssystems, sofern verfügbar).
  2. 02
    Modell für die Konversation auswählen
    In der Chatleiste zeigt die Modellauswahl alle Ihre Modelle an: Local (mit Haussymbol), Cloud (mit Anbietersymbol). Sie können mitten in einer Unterhaltung das Modell wechseln; Msty behält den Kontext bei.
  3. 03
    Regeln definieren
    Unter Settings → Default Model lässt sich das Standardmodell festlegen. Tipp: Wenn ein lokales Modell als Standard eingestellt ist, müssen Sie bewusst auswählen, wann Sie Daten an die Cloud senden möchten – hilfreich für den Datenschutz.
!
Privatsphäre: Vorsicht beim reflexhaften Griff zur Cloud
Die bequeme einheitliche Modellauswahl hat eine Kehrseite: Ein sensibler Prompt kann leicht versehentlich an OpenAI oder Anthropic gesendet werden. Wenn Sie vertrauliche Daten verarbeiten, erstellen Sie einen eigenen Workspace, in dem kein Cloud-Anbieter konfiguriert ist (siehe nächster Abschnitt), oder entfernen Sie die API-Schlüssel für diesen Kontext.

#4. Personalisierte Workspaces

Ein Workspace in Msty ist ein isolierter Raum mit eigenen Gesprächen, eigenen Knowledge Stacks, eigenem Standardmodell und eigenen aktivierten Anbietern. Konkret wird für jedes Nutzungsszenario ein eigener Workspace erstellt.

Perso
Lokales 7B-Modell, keine Cloud, Knowledge Stacks auf Basis Ihrer persönlichen Markdown-Notizen, Prompts in informellem Ton.
Arbeit
Lokales 14B-Modell + Claude in der Cloud für anspruchsvolle Aufgaben, Knowledge Stack auf Basis der internen Dokumentation (Verfahrensanweisungen, Runbooks).
Forschung & Entwicklung / Sandbox
Mehrere Modelle aktiviert für Experimente, häufiger Split-Chat, kein Knowledge Stack.
Vertraulich
Kein Cloud-Anbieter, ausschließlich lokaler Modellbetrieb, Knowledge Stack verschlüsselt auf OS-Ebene, um Kundendaten oder HR-Daten zu verarbeiten.

Erstellen: linke Seitenleiste → Symbol Workspaces → New Workspace. Jeder Workspace hat ein eigenes Symbol und eine eigene Farbe. Das hilft, Verwechslungen beim Kontext (und damit beim Modell oder Ziel) zu vermeiden.

#5. Knowledge Stacks (natives RAG)

Die Knowledge Stacks sind die zentrale Funktion von Msty. Sie bieten vollständiges RAG ohne jegliche Konfiguration: Msty übernimmt das Chunking, erzeugt die Embeddings mit einem lokalen Modell (standardmäßig mxbai-embed-large), speichert sie in einer integrierten Vektordatenbank und fügt bei einer Frage automatisch die relevanten Textpassagen in den Kontext des LLM ein.

  1. 01
    Einen Knowledge Stack erstellen
    Sidebar → Knowledge Stacks → New Stack. Geben Sie dem Stack einen Namen (z. B. „Rechtsdokumente“).
  2. 02
    Quellen hinzufügen
    Ziehen Sie Dateien (PDF, DOCX, MD, TXT, CSV, JSON) oder ganze Ordner per Drag-and-drop hinein. Sie können auch URLs (Msty crawlt die Seite), YouTube-Transkripte oder sogar ein GitHub-Repository per URL hinzufügen.
  3. 03
    Auf die Indexierung warten
    Msty zeigt den Fortschritt an: Textextraktion, Chunking (Standard: ca. 500 Tokens pro Chunk), Generierung der Embeddings. Für 100 PDF-Dateien beträgt die Bearbeitungszeit 5 bis 15 Minuten abhängig vom GPU-Modell.
  4. 04
    In einer Konversation aktivieren
    Im Chat unten auf das Symbol Knowledge Stack klicken → den gewünschten Stack mit einem Häkchen auswählen. Sie können mehrere Stacks gleichzeitig aktivieren. Msty zeigt unter jeder Antwort die verwendeten Quellen mit einem direkten Link zur Originalpassage an.
→
Embedding-Modell und Qualität auf Französisch
Standardmäßig verwendet Msty mxbai-embed-large, das mit französischen Texten ordentlich funktioniert. Bei ausschließlich französischsprachigen Inhalten verbessern Sie die Qualität, wenn Sie zu einem französischen Modell wie Solon-embeddings oder zum mehrsprachigen bge-m3 wechseln. Einstellung: Settings → Knowledge Stacks → Embedding Model. Alles bleibt lokal.
i
Einschränkungen, die Sie kennen sollten
Das RAG von Msty eignet sich sehr gut für 10–500 Dokumente. Darüber hinaus (10.000+ Dokumente, hybride BM25-Suche, individuell angepasstes Reranking) bleibt ein dedizierter Stack (Qdrant + LlamaIndex oder AnythingLLM) flexibler. Msty optimiert das Nutzungserlebnis, nicht die Anzahl der Dokumente.

#6. Split Chat und Vergleiche

Mit Split Chat können Sie in einem einzigen Fenster eine Frage an 2 Modelle (kostenlos) oder bis zu 4 Modelle (Aurum) stellen. Die Modelle werden dabei in Spalten nebeneinander angezeigt. Ideal, um ein neues Modell zu kalibrieren oder zwischen zwei Kandidaten zu entscheiden, ohne den Prompt erneut zu schreiben.

  1. 01
    Split Chat aktivieren
    Klicken Sie in einer Unterhaltung auf die Schaltfläche Split (Spaltensymbol) in der oberen Leiste. Eine zweite Spalte mit einer eigenen Modellauswahl erscheint.
  2. 02
    Jede Spalte konfigurieren
    Jede Spalte hat ihr eigenes Modell, ihre eigene Temperatur und ihren eigenen Systemprompt. Sie können ein lokal laufendes Qwen 3.5 9B anhand derselben Fragen mit Claude Haiku in der Cloud vergleichen.
  3. 03
    Synchronisierte oder unabhängige Konversation
    Standardmäßig wird jede Nachricht, die Sie eingeben, an beide Spalten gesendet. Sie können das Häkchen bei Sync entfernen, damit die Gespräche unterschiedliche Verläufe nehmen (zum Beispiel, wenn eine Antwort Sie wieder auf eine Idee gebracht hat, die Sie nur in einem der beiden Gesprächszweige vertiefen möchten).
Nützliches Vergleichsbeispiel
Prompt :
"Rédige un email professionnel poli pour refuser une réunion non urgente."

Colonne 1 : Qwen 3.5 9B local, température 0.7
Colonne 2 : Mistral Small 24B local, température 0.7

→ Comparaison directe du niveau de français, du ton, de la longueur,
de la pertinence des formules. Décide quel modèle
devient le défaut pour l'usage "rédaction".

#Msty vs Open WebUI vs LM Studio

Die drei sind grafische Benutzeroberflächen für LLM, aber ihr Schwerpunkt unterscheidet sich.

Msty
All-in-One-Desktop-App, Closed Source Freemium. 1-Klick-Installation. Am besten für: RAG ohne Code (Knowledge Stacks), gemischte Cloud- und lokale Umgebungen, Workspaces, geteilte Chats. Weniger flexibel für Multi-User oder Server-Deployment.
Open WebUI
Selbst gehostete Webanwendung, Open Source (BSD), Docker empfohlen. Integrierte Mehrbenutzerunterstützung (Authentifizierung, Rollen), konfigurierbares RAG, über jeden Browser im Netzwerk zugänglich. Am besten geeignet für: Bereitstellung für Teams oder Familien, vollständige Kontrolle, Serverhosting.
LM Studio
Kostenlose Desktop-App mit geschlossenem Quellcode. Der umfangreichste Hugging-Face-Katalog, natives MLX auf dem Mac, MCP-Unterstützung und Multi-Token-Vorhersage. Am besten geeignet für: das Testen vieler Modelle, reine Leistung und erweiterte Einstellungen. Einfache RAG-Funktion (Chat with Documents), aber weniger integriert als die Knowledge Stacks.
→
Wie man zwischen den drei wählt
Sie möchten Chat + lokales RAG ohne Programmieren und eine ausgefeilte Benutzererfahrung: Msty. Sie möchten eine Lösung für mehrere Benutzer im Netzwerk bereitstellen: Open WebUI. Sie möchten Modelle erkunden und das Beste aus der Inferenz-Engine herausholen: LM Studio. Sie können die Tools auch kombinieren – Msty kann eine Ollama-Instanz nutzen, die über Open WebUI auf einem anderen Rechner bereitgestellt wird.

#Fehlerbehebung

Das Modell lädt nicht (OOM)
Nicht genügend VRAM/RAM. Settings → Local AI → [Modell] → Advanced: Verringern Sie n_gpu_layers (weniger Schichten auf die GPU auslagern) oder n_ctx (Kontextfenster). Wechseln Sie andernfalls zu einer platzsparenderen Quantisierung (Q4_K_S, IQ3_M).
Wenige Tokens pro Sekunde
Prüfen Sie die GPU-Auslastung: nvidia-smi (NVIDIA), rocm-smi (AMD) oder Activity Monitor GPU (Mac). Wenn die GPU-Auslastung bei 0 % liegt, läuft Msty auf der CPU – überprüfen Sie die Treiber und stellen Sie sicher, dass Sie unter Windows die Variante Local + GPU verwenden.
Knowledge Stack liegt weiterhin bei 0 %
Für die Indexierung muss das Embedding-Modell heruntergeladen sein. Settings → Knowledge Stacks → Embedding Model: Prüfen Sie, ob mxbai-embed-large (oder das von Ihnen gewählte Modell) den Status Downloaded hat. Falls nicht, klicken Sie auf Download.
Anfrage an den Cloud-Anbieter schlägt mit Fehler 401 fehl
Ungültiger oder abgelaufener API-Schlüssel. Prüfen Sie dies im Dashboard des Anbieters. Stellen Sie bei OpenAI sicher, dass Sie über aktives Guthaben verfügen (Schlüssel ohne Guthaben liefern 401 oder 429 zurück).
Linux: AppImage startet nicht
Installieren Sie libfuse2 (sudo apt install libfuse2 auf Ubuntu 22.04+). Starten Sie die AppImage über einen Terminalbefehl, um den genauen Fehler zu sehen.
Verloren gegangene Gespräche nach Aktualisierung
Die Daten befinden sich im Msty-Ordner (Application Support auf dem Mac, AppData unter Windows, .config unter Linux). Prüfen Sie, ob ein Systembereinigungsprogramm diesen Ordner geleert hat. Es empfiehlt sich, diesen Ordner regelmäßig zu sichern.

#Weiterführende Informationen

Abhängig von der gewünschten Richtung:

Msty mit seinen Alternativen vergleichen
„Ollama vs LM Studio vs Jan vs GPT4All“ und „LM Studio vs Ollama: Welches Tool 2026 wählen?“ bieten einen umfassenden Überblick über lokale Benutzeroberflächen.
RAG über die Möglichkeiten der Knowledge Stacks hinaus nutzen
„Lokaler RAG mit Ollama ohne Programmieren (Open WebUI, AnythingLLM)“ behandelt die Alternativen, wenn man die Möglichkeiten der integrierten RAG-Funktion von Msty überschreitet.
Das richtige Modell für Msty auswählen
„Die Quantisierung (Q4, Q5, Q8, FP16) wählen“ hilft, den Kompromiss zwischen Qualität und VRAM im Produktkatalog von Msty zu finden.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.