SillyTavern: die Benutzeroberfläche für LLM-Charaktere lokal
SillyTavern ist eine Weboberfläche für Rollenspiele und interaktives Schreiben mit einem LLM. Sie führt selbst kein Modell aus: Sie verbindet sich mit einem lokalen Backend wie KoboldCpp oder Ollama und ergänzt alles, was im klassischen Chat fehlt – Charakterkarten, ein dauerhaftes Gedächtnis für die Spielwelt, eine detaillierte Steuerung des Prompts und Erweiterungen. Dieser Leitfaden behandelt die Installation, die Verbindung mit Ihrem Backend, die Erstellung von Charakteren und die Einstellungen, die bei der Darstellung der Rollen den Unterschied ausmachen.
#Warum SillyTavern anstelle eines klassischen Chats
Eine Oberfläche wie Open WebUI oder LM Studio behandelt jede Unterhaltung als Austausch zwischen Assistent und Benutzer. SillyTavern geht von einem anderen Bedarf aus: über Hunderte von Nachrichten hinweg einen in sich stimmigen Charakter verkörpern, in einer Welt, die sich an ihre eigenen Regeln erinnert. Es ist das maßgebliche Werkzeug der Community für Rollenspiele mit lokalen LLMs und bietet Mechaniken, die ein einfacher Chat nicht hat.
- Charakterkarten
- Ein standardisiertes Format (PNG mit eingebetteten Metadaten), das Persona, Stil, Dialogbeispiele und Begrüßungsnachricht beschreibt. Als einzelne Datei importierbar und teilbar.
- Weltgedächtnis
- Das Lorebook fügt nur dann Informationen in den Prompt ein, wenn ein Schlüsselwort auftaucht. So bleibt das Universum konsistent, ohne den Kontext zu überladen.
- Promptkontrolle
- Sie sehen und ändern jeden Baustein, der an das Modell gesendet wird: Systemprompt, Anweisungsformat, Reihenfolge der Einfügung. Nichts ist verborgen.
- Backend nach Wahl
- SillyTavern ist ein reines Frontend. Derselbe Charakter lässt sich mit KoboldCpp, Ollama, llama.cpp oder einer entfernten API nutzen, ohne etwas neu schreiben zu müssen.
#Voraussetzungen und Auswahl des Backends
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
SillyTavern läuft mit Node.js (Version 18 oder höher) unter Windows, macOS und Linux. Der Ressourcenbedarf ist gering – den VRAM beansprucht das Backend. Zwei lokale Backends decken nahezu alle Anwendungsfälle ab: KoboldCpp mit Schwerpunkt auf GGUF und Rollenspiel sowie das breiter einsetzbare Ollama.
- KoboldCpp
- Eine einzige ausführbare Datei, die GGUF-Modelle ausführt und eine API bietet, die SillyTavern nativ unterstützt. Fein abgestimmte Speichereinstellungen, Unterstützung für AMD ROCm. Die Standardwahl der RP-Community.
- Ollama
- Der Daemon lauscht auf http://localhost:11434. Praktisch, wenn Sie ihn bereits für andere Zwecke verwenden; SillyTavern verbindet sich über seinen kompatiblen Endpunkt damit.
- llama.cpp (llama-server)
- OpenAI-kompatibler HTTP-Server für maximale Steuerung des Layer-Offloadings.
- VRAM
- In Q4_K_M: Ein 7B-Modell passt in etwa 5 GB, ein 14B-Modell in etwa 9 GB, ein 32B-Modell in etwa 19 GB. Für flüssiges Rollenspiel sollten Sie mindestens ein 12-14B-Modell anstreben, sofern Ihre Grafikkarte dies ermöglicht.
#SillyTavern installieren
Die empfohlene Methode ist der Git-Clone: Er ermöglicht einfache Aktualisierungen (ein git pull) und SillyTavern entwickelt sich schnell. Stellen Sie sicher, dass Node.js 18+ und Git installiert sind.
- 01Repository klonenHolen Sie sich den stabilen und getesteten Branch release. Vermeiden Sie den Branch staging, es sei denn, Sie möchten Neuerungen vorab ausprobieren und dafür einige Bugs in Kauf nehmen.
- 02Das Startskript startenstart.sh unter Linux/macOS, Start.bat unter Windows. Bei dem ersten Start installiert npm die Abhängigkeiten automatisch.
- 03Oberfläche öffnenSillyTavern stellt seine Benutzeroberfläche unter http://localhost:8000 bereit. Öffnen Sie diese Adresse in Ihrem Browser; eine Desktop-Anwendung müssen Sie nicht installieren.
- 04Später aktualisierenFühren Sie im Ordner git pull aus und starten Sie anschließend das Skript erneut. Ihre Charaktere und Gespräche werden separat in data/ gespeichert und nicht überschrieben.
#Das lokale Backend verbinden
Sobald SillyTavern geöffnet ist, läuft alles über den Tab für die API-Verbindung (das Steckersymbol oben). Das Prinzip: einerseits das Backend starten, andererseits dessen Adresse in SillyTavern angeben.
#Mit KoboldCpp
Starten Sie KoboldCpp mit Ihrem GGUF-Modell; standardmäßig wird seine API auf dem Port 5001 verfügbar gemacht. In SillyTavern wählen Sie den API-Typ „Text Completion“ aus, dann den Backend-Typ „KoboldCpp“ und geben Sie die URL ein. Klicken Sie auf Connect: Der Name des geladenen Modells wird angezeigt, wenn alles korrekt ist.
#Mit Ollama
Ollama läuft bereits als Daemon auf dem Port 11434. In SillyTavern wählen Sie „Text Completion“ aus, dann den Backend-Provider „Ollama“, geben Sie die Adresse ein und wählen Sie das Modell aus der automatisch abgerufenen Dropdown-Liste.
#Erstellen und Importieren von Charakterkarten
Die Charakterkarte ist das Herz von SillyTavern. Es handelt sich um eine PNG-Datei, deren Bild als Avatar dient und deren eingebundene Metadaten den Charakter beschreiben. Sie können eine solche Karte von Grund auf erstellen oder eine von der Community geteilte Karte importieren.
#Die relevanten Felder
- Beschreibung
- Die Grundlage der Figur: Aussehen, Charakterzüge, Vorgeschichte. Diese Angaben werden dauerhaft in den Kontext eingefügt. Formulieren Sie daher kompakt und konkret statt weitschweifig.
- Personality
- Eine Zusammenfassung des Temperaments. Hilfreich, um den Ton festzulegen, ohne die gesamte Beschreibung neu zu schreiben.
- First message
- Die Begrüßungsnachricht, die die Szene vorgibt. Sie gibt den erwarteten Ton, Schreibstil und das erwartete Format vor — das Modell neigt dazu, ihre Form nachzuahmen.
- Example dialogues
- Beispiele für Äußerungen, die dem Modell zeigen, wie die Figur spricht. Sehr wirksam, um einen bestimmten Sprachstil festzulegen.
- Scenario
- Der Szenenkontext, getrennt von der Charakterbeschreibung. Praktisch, um denselben Charakter in verschiedenen Situationen zu verwenden.
- 01Das Charakter-Panel öffnenDas Charaktersymbol in der oberen Leiste öffnet die Liste. Die Schaltfläche „+“ erstellt eine leere Karte.
- 02Beschreibung eintragenBeschreiben Sie die Figur kompakt und detailreich. Viele Autoren verwenden ein strukturiertes Format (Listen von Eigenschaften) statt eines Absatzes; damit kommen die Modelle gut zurecht.
- 03Die erste Nachricht schreibenGestalten Sie ihn sorgfältig: Er ist Ihr wichtigster Hebel für den Stil. Eine erzählerische Begrüßungsnachricht in der dritten Person lenkt das Modell in Richtung dieses Formats.
- 04Eine bestehende Karte importierenZiehen Sie eine Karte im PNG-Format in die Liste oder importieren Sie sie. Karten werden auf Community-Hubs als einfache Bilddateien geteilt.
#Die persistente Welt: das Lorebook
Das Lorebook (oder World Info) löst das zentrale Problem langer Spielrunden: Wie hält man eine Welt konsistent, ohne ständig alle Informationen einzuspeisen? Das Prinzip ist die bedingte Einspeisung anhand von Schlüsselwörtern.
Sie erstellen Einträge, die jeweils mit einem oder mehreren Schlüsselwörtern verknüpft sind. Sobald eines dieser Wörter in den letzten Nachrichten vorkommt, wird der entsprechende Eintrag direkt vor der Generierung in den Kontext eingefügt. Ansonsten nimmt er keinen Platz ein. So können Sie Dutzende von Orten, Nebenfiguren und Regeln beschreiben, ohne den Prompt jemals zu überlasten.
- Eingabe
- Ein Textblock (die einzufügende Lore) und seine auslösenden Schlüsselwörter. Beispiel: Schlüsselwort „Valmont“ → Beschreibung der Stadt Valmont.
- Konstant vs. selektiv
- Ein Eintrag kann immer aktiv sein (grundlegende Regeln der fiktionalen Welt) oder nur durch ein Schlüsselwort aktiviert werden (kontextbezogene Details).
- Injektionstiefe
- Sie wählen, an welcher Position der Eintrag in den Prompt eingefügt wird. Das beeinflusst, wie stark das Modell ihn gewichtet.
- An einen Charakter gebunden oder global
- Ein Lorebook kann einer bestimmten Karte zugeordnet sein oder als gemeinsames Universum für alle Ihre Gespräche gelten.
#Die Generierung für das Rollenspiel einstellen
Die Sampling-Parameter bestimmen das Verhältnis zwischen Kohärenz und Kreativität. Bei Rollenspielen ist mehr Vielfalt gefragt als bei sachlicher Unterstützung, ohne dass die Antworten inkohärent werden. Diese Einstellungen finden Sie auf der Registerkarte für die Generierungseinstellungen (Symbol mit Schiebereglern).
- Temperatur
- Der Regler für Kreativität und Stabilität. Etwa 0,7–0,9 sorgen für ein gutes Gleichgewicht beim Rollenspiel. Zu hohe Werte (> 1,2) führen zu Inkohärenz; zu niedrige Werte machen den Charakter repetitiv und eindimensional.
- Min-P
- Ein moderner Sampler, der unwahrscheinliche Tokens anhand ihrer Wahrscheinlichkeit im Verhältnis zum wahrscheinlichsten Token ausschließt. Ein Wert von 0,05 bis 0,1 bereinigt die Ausgabe und erlaubt es, die Temperatur zu erhöhen, ohne dass die Ausgabe aus dem Ruder läuft.
- Wiederholungsstrafe
- Bestraft die Wiederholung derselben Tokens. Hilfreich gegen Schleifen, zwingt das Modell bei zu hoher Einstellung aber zu künstlichen Formulierungen. Wählen Sie einen moderaten Wert.
- Response length
- Die maximale Anzahl generierter Tokens pro Antwort. 200–400 Tokens für gehaltvolle erzählerische Antworten ohne endlose Monologe.
- Context size
- Muss der Kontextgröße entsprechen, die Ihr Backend geladen hat. Es ist sinnlos, in SillyTavern 16k anzufordern, wenn KoboldCpp nur mit 8k gestartet wurde.
#Erweiterungen, die das Nutzungserlebnis verändern
SillyTavern ist erweiterbar. Einige Erweiterungen sind standardmäßig enthalten, andere werden über ihre Repository-URL installiert. Folgende Erweiterungen verändern das Nutzungserlebnis wirklich.
- Vector Storage (Gedächtniszusammenfassung)
- Vektorisiert den Verlauf und fügt relevante Passagen aus alten Nachrichten wieder ein, wodurch das Gedächtnis über das Kontextfenster hinaus erweitert wird. Nützlich für sehr lange Spielrunden.
- Summarize
- Erstellt eine fortlaufende Zusammenfassung des Gesprächs, hält sie aktuell und fügt sie wieder in den Prompt ein. Die Figur erinnert sich auch nach Hunderten von Nachrichten an die wichtigsten Ereignisse.
- Text-to-Speech
- Gibt den Charakteren über eine lokale TTS-Engine eine Stimme. Mehr Immersion für alle, die beim Spielen sprechen.
- Image generation
- Verbindet sich mit einem lokalen Bild-Backend (z. B. Stable Diffusion), um direkt aus dem Chat heraus spontan Szenen und Figuren zu illustrieren.
- Gesichtsausdrücke
- Zeigt den Avatar mit einem zum Ton der Nachricht passenden Gefühlsausdruck an, basierend auf einem Sprite-Set der Figur.
#Welche lokalen Modelle eignen sich besonders gut für Rollenspiele?
Nicht alle LLMs eignen sich gleichermaßen für Rollenspiele. „Instruct“-Modelle, die auf Assistenzaufgaben ausgerichtet sind, neigen dazu, aus der Rolle zu fallen, zu moralisieren oder fiktionale Szenarien abzulehnen. Die Community bevorzugt spezialisierte Fine-Tunes, die oft auf soliden Basismodellen aufbauen und anschließend für das Erzählen von Geschichten und Dialoge in der jeweiligen Rolle weitertrainiert werden.
- Sinnvolle Modellgröße
- Unter 4B leidet die Konsistenz der Figur auf Dauer. 2026 bietet eine aktuelle Basis wie Qwen 3.5 9B (~6,6 GB, 256k Kontext) oder Gemma 4 12B (~7,6 GB, Apache 2.0) den besten Kompromiss für die meisten Grafikkarten der Mittelklasse. Eine Stufe darüber passt Mistral Small 24B (~14 GB, besonders gut auf Französisch) in 16 GB und bietet mehr erzählerische Feinheit.
- RP-Fine-Tunes
- Suchen Sie nach Modellen, die ausdrücklich für Rollenspiele oder fiktionale Texte trainiert wurden (auf Hugging Face häufig mit „RP“, „storytelling“ oder „uncensored“ gekennzeichnet). Die besten Fine-Tunes von 2026 basieren auf diesen neueren Basismodellen (Qwen 3.5, Mistral Small 24B, Gemma 4) statt auf den alten Modellen Llama 2 oder Mistral 7B von 2023; sie halten sich besser an das Format der Karten.
- Langer Kontext
- Bevorzugen Sie ein Modell, das auch bei 16k+ Tokens stabil bleibt, ohne qualitativ abzubauen: Lange Spielsitzungen erfordern das. Prüfen Sie das angegebene native Kontextfenster des Modells.
- GGUF-Format
- Bleiben Sie für KoboldCpp bei quantisierten GGUF-Modellen. Q4_K_M ist der empfohlene Kompromiss; wechseln Sie zu Q5_K_M oder Q8_0, wenn Ihr VRAM es zulässt und Sie feinere Ergebnisse wünschen.
#Behebung häufiger Probleme
- SillyTavern verbindet sich nicht
- Prüfen Sie, ob das Backend läuft und der Port stimmt (5001 für KoboldCpp, 11434 für Ollama). Ein Test der API-URL im Browser bestätigt, dass die API antwortet.
- Antworten mit sichtbaren Tags
- Fast immer liegt es an einer ungeeigneten Instruktionsvorlage. Passen Sie unter Advanced Formatting das Format (ChatML, Gemma, Mistral…) an das des Modells an.
- Die Figur fällt aus ihrer Rolle
- Ergänzen Sie die Beschreibung und die Dialogbeispiele, senken Sie die Temperatur etwas und prüfen Sie, ob Ihr System-Prompt mit der Charakterkarte im Widerspruch steht.
- Wiederholungen und Schleifen
- Erhöhen Sie die Wiederholungsstrafe leicht und fügen Sie Min-P hinzu. Wenn das Problem weiterhin besteht, ist das Kontextfenster möglicherweise voll: Aktivieren Sie Summarize oder reduzieren Sie die Größe der Charakterkarte.
- Abgeschnittene Antworten
- „Response length“ ist zu niedrig eingestellt, oder das Backend wurde mit einem kleineren Kontext gestartet, als SillyTavern anfordert. Stimmen Sie die beiden Werte aufeinander ab.
#Weiterführende Informationen
SillyTavern ist nur eine Schicht: Die endgültige Qualität hängt vor allem von Ihrem Backend und dem Modell ab. Diese Anleitungen helfen, die Grundlagen zu stärken.
- KoboldCpp: Installation und erste Schritte
- Das Referenz-Backend für lokales RP: GGUF, Speichereinstellungen und eine API, die SillyTavern nativ unterstützt.
- Ollama, was ist das und wie funktioniert es?
- Die allgemeine Alternative, wenn Sie einen einzigen Daemon auf dem Port 11434 für alle Ihre Anwendungen bevorzugen.
- Den KV-Cache quantisieren
- Um längere RP-Kontexte auf derselben Grafikkarte unterzubringen, ohne den VRAM zu überlasten.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.