Msty: die elegante Oberfläche für lokale LLMs (Mac, Windows, Linux)
Msty ist eine Desktop-App, die beim lokalen Ausführen von LLMs ganz auf die Benutzererfahrung setzt. Während Open WebUI Docker erfordert und LM Studio sich auf die Engine konzentriert, bietet Msty mit einem einzigen Installationsprogramm: ein lokales Modell, Cloud-Modelle (OpenAI, Claude, Gemini) nebeneinander, integriertes RAG über die Knowledge Stacks, Workspaces und Split Chat zum Vergleich zweier Modelle. Dieser Leitfaden zeigt, wie Sie Msty auf Mac, Windows und Linux installieren und für den ernsthaften Einsatz lokaler LLMs nutzen.
#Warum Msty
Msty (msty.app) richtet sich an eine bestimmte Zielgruppe: Menschen, die eine übersichtlich gestaltete grafische App ohne Docker und ohne CLI möchten, aber mit echten Funktionen über einen einfachen Chat hinaus. Drei Alleinstellungsmerkmale bringen das Tool auf den Punkt.
- Alles in einer einzigen App
- Integrierte Inferenz-Engine (auf Basis von llama.cpp), ein Client für Ollama, falls Sie es bereits installiert haben, und Cloud-Konnektoren – Sie müssen keinen Stack selbst zusammenstellen.
- Knowledge Stacks
- RAG ist nativ integriert und erfordert keinen Code. PDFs, Markdown-Dateien, ganze Ordner oder sogar URLs lassen sich per Drag-and-Drop hinzufügen. Msty übernimmt das Chunking, die Embeddings und das Retrieval.
- Workspaces und Split Chat
- Mehrere isolierte Arbeitsbereiche (privat, beruflich, Forschung und Entwicklung) und die Möglichkeit, dieselbe Frage parallel an 2 bis 4 Modelle in derselben Ansicht zu stellen.
#Voraussetzungen
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
- OS
- macOS 11+ (Apple Silicon oder Intel), Windows 10/11 (x64), Linux x64 (AppImage und Pakete .deb/.rpm)
- Minimale RAM-Anforderung
- 8 GB für ein 3B-Modell in Q4_K_M, 16 GB für 7B, 32 GB für einen komfortablen Betrieb von 14B, 64 GB, wenn Sie 32B anstreben.
- GPU
- Optional, aber empfohlen. NVIDIA mit CUDA, AMD mit ROCm/Vulkan, Apple Silicon mit Metal — Msty erkennt und nutzt die GPU automatisch.
- Speicher
- Je nach Anzahl der Modelle 10–50 GB einplanen. GGUF-Dateien in Q4 reichen von 2 GB (3B) bis 40 GB (70B).
#1. Installation
Msty lässt sich ausschließlich von der offiziellen Website herunterladen. Derzeit gibt es keine Installation über Paketmanager (weder Homebrew noch winget), was die Überprüfung der Downloadquelle vereinfacht.
- 01Installationsdatei herunterladenBesuchen Sie msty.app und wählen Sie Ihr Betriebssystem aus. Drei Varianten werden angeboten: Online (abgespeckt, nur für die Cloud), Local (empfohlen, enthält die Inferenz-Engine) und Local + GPU (mit gebündelten CUDA-Treibern für Windows).
- 02Installieren (Mac)Öffnen Sie die .dmg-Datei, ziehen Sie Msty in den Ordner Applications und starten Sie die App beim ersten Mal per Rechtsklick → Öffnen (Gatekeeper). macOS verlangt eine Bestätigung, da die App nicht vom App Store notarisiert ist.
- 03Installieren (Windows)Starten Sie die .exe-Datei. Wählen Sie die GPU-Version, wenn Sie eine aktuelle NVIDIA-Karte besitzen — sie enthält die CUDA-Runtimes und erspart Ihnen das manuelle Herumbasteln an den Treibern. Andernfalls reicht die Version Local CPU/Vulkan aus.
- 04Installieren (Linux)AppImage: chmod +x Msty-*.AppImage und dann ./Msty-*.AppImage. .deb: sudo dpkg -i msty_*.deb. .rpm: sudo rpm -i msty-*.rpm. Bei AppImage kann libfuse2 je nach Distribution erforderlich sein.
- 05Erster StartMsty erstellt sein Datenverzeichnis (~/Library/Application Support/Msty auf dem Mac, %APPDATA%\Msty unter Windows, ~/.config/Msty unter Linux). Dort werden Modelle, Unterhaltungen und Knowledge Stacks gespeichert.
#2. Erstes lokales Modell
Msty bietet eine Einführung, bei der Sie mit einem Klick ein kleines Einstiegsmodell herunterladen können. Sie können auch direkt aus dem Katalog wählen. Drei gute Optionen für Französisch zum Einstieg, je nach Ihrer Hardware:
- Kleine Konfiguration (8 GB RAM, ohne GPU)
- Qwen 3.5 2B Q4_K_M (≈1,9 GB) oder Granite 4.2 3B (≈2,2 GB). Auch im reinen CPU-Betrieb nutzbar, ideal für Gespräche, Brainstorming und die Zusammenfassung kurzer Texte.
- Standardkonfiguration (16 GB RAM, GPU 6–8 GB)
- Qwen 3.5 9B Q4_K_M (≈6,6 GB), mit 256k Kontext und Bildverarbeitung. Der beste vielseitige Kompromiss für Französisch und Englisch im Alltag.
- Komfortkonfiguration (32 GB RAM, GPU 12–24 GB)
- Mistral Small 24B (≈14 GB) oder Qwen 3.8 27B in Q4_K_M (≈18 GB). Deutlich bessere Fähigkeit zum logischen Schlussfolgern, das Nutzungserlebnis nähert sich dem von Cloud-Modellen an.
Zum Herunterladen öffnen Sie die Registerkarte Local AI Models in der linken Seitenleiste und klicken anschließend auf Browse and Download Online Model. Msty verweist auf Hugging Face und filtert nach kompatiblen GGUF-Versionen. Der Fortschritt wird angezeigt; sobald der Download abgeschlossen ist, lässt sich das Modell auswählen.
#3. Cloud + lokal parallel
Das ist eine der Stärken von Msty: Sie können Ihre Cloud-API-Schlüssel hinzufügen (OpenAI, Anthropic, Google, OpenRouter, Groq, Mistral Cloud usw.) und diese Modelle in derselben Benutzeroberfläche wie Ihre lokalen Modelle nutzen. Für eine neue Unterhaltung wählen Sie das Modell über ein einfaches Dropdown-Menü aus, das beide Welten zusammenführt.
- 01Einen Cloud-Anbieter hinzufügenSettings → Remote Model Providers → Add. Fügen Sie Ihren API-Schlüssel ein. Msty speichert den Schlüssel lokal (verschlüsselt durch den Schlüsselbund des Betriebssystems, sofern verfügbar).
- 02Modell für die Konversation auswählenIn der Chatleiste zeigt die Modellauswahl alle Ihre Modelle an: Local (mit Haussymbol), Cloud (mit Anbietersymbol). Sie können mitten in einer Unterhaltung das Modell wechseln; Msty behält den Kontext bei.
- 03Regeln definierenUnter Settings → Default Model lässt sich das Standardmodell festlegen. Tipp: Wenn ein lokales Modell als Standard eingestellt ist, müssen Sie bewusst auswählen, wann Sie Daten an die Cloud senden möchten – hilfreich für den Datenschutz.
#4. Personalisierte Workspaces
Ein Workspace in Msty ist ein isolierter Raum mit eigenen Gesprächen, eigenen Knowledge Stacks, eigenem Standardmodell und eigenen aktivierten Anbietern. Konkret wird für jedes Nutzungsszenario ein eigener Workspace erstellt.
- Perso
- Lokales 7B-Modell, keine Cloud, Knowledge Stacks auf Basis Ihrer persönlichen Markdown-Notizen, Prompts in informellem Ton.
- Arbeit
- Lokales 14B-Modell + Claude in der Cloud für anspruchsvolle Aufgaben, Knowledge Stack auf Basis der internen Dokumentation (Verfahrensanweisungen, Runbooks).
- Forschung & Entwicklung / Sandbox
- Mehrere Modelle aktiviert für Experimente, häufiger Split-Chat, kein Knowledge Stack.
- Vertraulich
- Kein Cloud-Anbieter, ausschließlich lokaler Modellbetrieb, Knowledge Stack verschlüsselt auf OS-Ebene, um Kundendaten oder HR-Daten zu verarbeiten.
Erstellen: linke Seitenleiste → Symbol Workspaces → New Workspace. Jeder Workspace hat ein eigenes Symbol und eine eigene Farbe. Das hilft, Verwechslungen beim Kontext (und damit beim Modell oder Ziel) zu vermeiden.
#5. Knowledge Stacks (natives RAG)
Die Knowledge Stacks sind die zentrale Funktion von Msty. Sie bieten vollständiges RAG ohne jegliche Konfiguration: Msty übernimmt das Chunking, erzeugt die Embeddings mit einem lokalen Modell (standardmäßig mxbai-embed-large), speichert sie in einer integrierten Vektordatenbank und fügt bei einer Frage automatisch die relevanten Textpassagen in den Kontext des LLM ein.
- 01Einen Knowledge Stack erstellenSidebar → Knowledge Stacks → New Stack. Geben Sie dem Stack einen Namen (z. B. „Rechtsdokumente“).
- 02Quellen hinzufügenZiehen Sie Dateien (PDF, DOCX, MD, TXT, CSV, JSON) oder ganze Ordner per Drag-and-drop hinein. Sie können auch URLs (Msty crawlt die Seite), YouTube-Transkripte oder sogar ein GitHub-Repository per URL hinzufügen.
- 03Auf die Indexierung wartenMsty zeigt den Fortschritt an: Textextraktion, Chunking (Standard: ca. 500 Tokens pro Chunk), Generierung der Embeddings. Für 100 PDF-Dateien beträgt die Bearbeitungszeit 5 bis 15 Minuten abhängig vom GPU-Modell.
- 04In einer Konversation aktivierenIm Chat unten auf das Symbol Knowledge Stack klicken → den gewünschten Stack mit einem Häkchen auswählen. Sie können mehrere Stacks gleichzeitig aktivieren. Msty zeigt unter jeder Antwort die verwendeten Quellen mit einem direkten Link zur Originalpassage an.
#6. Split Chat und Vergleiche
Mit Split Chat können Sie in einem einzigen Fenster eine Frage an 2 Modelle (kostenlos) oder bis zu 4 Modelle (Aurum) stellen. Die Modelle werden dabei in Spalten nebeneinander angezeigt. Ideal, um ein neues Modell zu kalibrieren oder zwischen zwei Kandidaten zu entscheiden, ohne den Prompt erneut zu schreiben.
- 01Split Chat aktivierenKlicken Sie in einer Unterhaltung auf die Schaltfläche Split (Spaltensymbol) in der oberen Leiste. Eine zweite Spalte mit einer eigenen Modellauswahl erscheint.
- 02Jede Spalte konfigurierenJede Spalte hat ihr eigenes Modell, ihre eigene Temperatur und ihren eigenen Systemprompt. Sie können ein lokal laufendes Qwen 3.5 9B anhand derselben Fragen mit Claude Haiku in der Cloud vergleichen.
- 03Synchronisierte oder unabhängige KonversationStandardmäßig wird jede Nachricht, die Sie eingeben, an beide Spalten gesendet. Sie können das Häkchen bei Sync entfernen, damit die Gespräche unterschiedliche Verläufe nehmen (zum Beispiel, wenn eine Antwort Sie wieder auf eine Idee gebracht hat, die Sie nur in einem der beiden Gesprächszweige vertiefen möchten).
#Msty vs Open WebUI vs LM Studio
Die drei sind grafische Benutzeroberflächen für LLM, aber ihr Schwerpunkt unterscheidet sich.
- Msty
- All-in-One-Desktop-App, Closed Source Freemium. 1-Klick-Installation. Am besten für: RAG ohne Code (Knowledge Stacks), gemischte Cloud- und lokale Umgebungen, Workspaces, geteilte Chats. Weniger flexibel für Multi-User oder Server-Deployment.
- Open WebUI
- Selbst gehostete Webanwendung, Open Source (BSD), Docker empfohlen. Integrierte Mehrbenutzerunterstützung (Authentifizierung, Rollen), konfigurierbares RAG, über jeden Browser im Netzwerk zugänglich. Am besten geeignet für: Bereitstellung für Teams oder Familien, vollständige Kontrolle, Serverhosting.
- LM Studio
- Kostenlose Desktop-App mit geschlossenem Quellcode. Der umfangreichste Hugging-Face-Katalog, natives MLX auf dem Mac, MCP-Unterstützung und Multi-Token-Vorhersage. Am besten geeignet für: das Testen vieler Modelle, reine Leistung und erweiterte Einstellungen. Einfache RAG-Funktion (Chat with Documents), aber weniger integriert als die Knowledge Stacks.
#Fehlerbehebung
- Das Modell lädt nicht (OOM)
- Nicht genügend VRAM/RAM. Settings → Local AI → [Modell] → Advanced: Verringern Sie n_gpu_layers (weniger Schichten auf die GPU auslagern) oder n_ctx (Kontextfenster). Wechseln Sie andernfalls zu einer platzsparenderen Quantisierung (Q4_K_S, IQ3_M).
- Wenige Tokens pro Sekunde
- Prüfen Sie die GPU-Auslastung: nvidia-smi (NVIDIA), rocm-smi (AMD) oder Activity Monitor GPU (Mac). Wenn die GPU-Auslastung bei 0 % liegt, läuft Msty auf der CPU – überprüfen Sie die Treiber und stellen Sie sicher, dass Sie unter Windows die Variante Local + GPU verwenden.
- Knowledge Stack liegt weiterhin bei 0 %
- Für die Indexierung muss das Embedding-Modell heruntergeladen sein. Settings → Knowledge Stacks → Embedding Model: Prüfen Sie, ob mxbai-embed-large (oder das von Ihnen gewählte Modell) den Status Downloaded hat. Falls nicht, klicken Sie auf Download.
- Anfrage an den Cloud-Anbieter schlägt mit Fehler 401 fehl
- Ungültiger oder abgelaufener API-Schlüssel. Prüfen Sie dies im Dashboard des Anbieters. Stellen Sie bei OpenAI sicher, dass Sie über aktives Guthaben verfügen (Schlüssel ohne Guthaben liefern 401 oder 429 zurück).
- Linux: AppImage startet nicht
- Installieren Sie libfuse2 (sudo apt install libfuse2 auf Ubuntu 22.04+). Starten Sie die AppImage über einen Terminalbefehl, um den genauen Fehler zu sehen.
- Verloren gegangene Gespräche nach Aktualisierung
- Die Daten befinden sich im Msty-Ordner (Application Support auf dem Mac, AppData unter Windows, .config unter Linux). Prüfen Sie, ob ein Systembereinigungsprogramm diesen Ordner geleert hat. Es empfiehlt sich, diesen Ordner regelmäßig zu sichern.
#Weiterführende Informationen
Abhängig von der gewünschten Richtung:
- Msty mit seinen Alternativen vergleichen
- „Ollama vs LM Studio vs Jan vs GPT4All“ und „LM Studio vs Ollama: Welches Tool 2026 wählen?“ bieten einen umfassenden Überblick über lokale Benutzeroberflächen.
- RAG über die Möglichkeiten der Knowledge Stacks hinaus nutzen
- „Lokaler RAG mit Ollama ohne Programmieren (Open WebUI, AnythingLLM)“ behandelt die Alternativen, wenn man die Möglichkeiten der integrierten RAG-Funktion von Msty überschreitet.
- Das richtige Modell für Msty auswählen
- „Die Quantisierung (Q4, Q5, Q8, FP16) wählen“ hilft, den Kompromiss zwischen Qualität und VRAM im Produktkatalog von Msty zu finden.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.