Mittelstufe 12 Min.Oberflächen

SillyTavern: die Benutzeroberfläche für LLM-Charaktere lokal

SillyTavern ist eine Weboberfläche für Rollenspiele und interaktives Schreiben mit einem LLM. Sie führt selbst kein Modell aus: Sie verbindet sich mit einem lokalen Backend wie KoboldCpp oder Ollama und ergänzt alles, was im klassischen Chat fehlt – Charakterkarten, ein dauerhaftes Gedächtnis für die Spielwelt, eine detaillierte Steuerung des Prompts und Erweiterungen. Dieser Leitfaden behandelt die Installation, die Verbindung mit Ihrem Backend, die Erstellung von Charakteren und die Einstellungen, die bei der Darstellung der Rollen den Unterschied ausmachen.

Von Léa B.·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum SillyTavern anstelle eines klassischen Chats

Eine Oberfläche wie Open WebUI oder LM Studio behandelt jede Unterhaltung als Austausch zwischen Assistent und Benutzer. SillyTavern geht von einem anderen Bedarf aus: über Hunderte von Nachrichten hinweg einen in sich stimmigen Charakter verkörpern, in einer Welt, die sich an ihre eigenen Regeln erinnert. Es ist das maßgebliche Werkzeug der Community für Rollenspiele mit lokalen LLMs und bietet Mechaniken, die ein einfacher Chat nicht hat.

Charakterkarten
Ein standardisiertes Format (PNG mit eingebetteten Metadaten), das Persona, Stil, Dialogbeispiele und Begrüßungsnachricht beschreibt. Als einzelne Datei importierbar und teilbar.
Weltgedächtnis
Das Lorebook fügt nur dann Informationen in den Prompt ein, wenn ein Schlüsselwort auftaucht. So bleibt das Universum konsistent, ohne den Kontext zu überladen.
Promptkontrolle
Sie sehen und ändern jeden Baustein, der an das Modell gesendet wird: Systemprompt, Anweisungsformat, Reihenfolge der Einfügung. Nichts ist verborgen.
Backend nach Wahl
SillyTavern ist ein reines Frontend. Derselbe Charakter lässt sich mit KoboldCpp, Ollama, llama.cpp oder einer entfernten API nutzen, ohne etwas neu schreiben zu müssen.
i
SillyTavern ersetzt Ihren Inferenzserver nicht
Es ist eine Benutzeroberfläche. Sie benötigen weiterhin ein Backend, das das Modell lädt und die Generierung ausführt. SillyTavern beschränkt sich darauf, den Prompt zu orchestrieren und das Ergebnis anzuzeigen.

#Voraussetzungen und Auswahl des Backends

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

SillyTavern läuft mit Node.js (Version 18 oder höher) unter Windows, macOS und Linux. Der Ressourcenbedarf ist gering – den VRAM beansprucht das Backend. Zwei lokale Backends decken nahezu alle Anwendungsfälle ab: KoboldCpp mit Schwerpunkt auf GGUF und Rollenspiel sowie das breiter einsetzbare Ollama.

KoboldCpp
Eine einzige ausführbare Datei, die GGUF-Modelle ausführt und eine API bietet, die SillyTavern nativ unterstützt. Fein abgestimmte Speichereinstellungen, Unterstützung für AMD ROCm. Die Standardwahl der RP-Community.
Ollama
Der Daemon lauscht auf http://localhost:11434. Praktisch, wenn Sie ihn bereits für andere Zwecke verwenden; SillyTavern verbindet sich über seinen kompatiblen Endpunkt damit.
llama.cpp (llama-server)
OpenAI-kompatibler HTTP-Server für maximale Steuerung des Layer-Offloadings.
VRAM
In Q4_K_M: Ein 7B-Modell passt in etwa 5 GB, ein 14B-Modell in etwa 9 GB, ein 32B-Modell in etwa 19 GB. Für flüssiges Rollenspiel sollten Sie mindestens ein 12-14B-Modell anstreben, sofern Ihre Grafikkarte dies ermöglicht.
→
Langer Kontext = mehr VRAM
Rollenspiele leben von langen Kontexten (8k, 16k, 32k Tokens). Der KV-Cache wächst mit dem Kontext und benötigt zusätzlich zu den Modellgewichten VRAM. Planen Sie Reserven ein oder quantisieren Sie den KV-Cache, um auf derselben Karte einen längeren Kontext unterzubringen.

#SillyTavern installieren

Die empfohlene Methode ist der Git-Clone: Er ermöglicht einfache Aktualisierungen (ein git pull) und SillyTavern entwickelt sich schnell. Stellen Sie sicher, dass Node.js 18+ und Git installiert sind.

  1. 01
    Repository klonen
    Holen Sie sich den stabilen und getesteten Branch release. Vermeiden Sie den Branch staging, es sei denn, Sie möchten Neuerungen vorab ausprobieren und dafür einige Bugs in Kauf nehmen.
  2. 02
    Das Startskript starten
    start.sh unter Linux/macOS, Start.bat unter Windows. Bei dem ersten Start installiert npm die Abhängigkeiten automatisch.
  3. 03
    Oberfläche öffnen
    SillyTavern stellt seine Benutzeroberfläche unter http://localhost:8000 bereit. Öffnen Sie diese Adresse in Ihrem Browser; eine Desktop-Anwendung müssen Sie nicht installieren.
  4. 04
    Später aktualisieren
    Führen Sie im Ordner git pull aus und starten Sie anschließend das Skript erneut. Ihre Charaktere und Gespräche werden separat in data/ gespeichert und nicht überschrieben.
Terminal (Linux/macOS)
# Cloner la branche stable
git clone https://github.com/SillyTavern/SillyTavern -b release
cd SillyTavern

# Premier lancement : installe les dépendances puis démarre
./start.sh

# Interface accessible sur http://localhost:8000
PowerShell (Windows)
git clone https://github.com/SillyTavern/SillyTavern -b release
cd SillyTavern

# Double-cliquez Start.bat, ou en ligne de commande :
.\Start.bat
i
Netzwerkzugriff und Sicherheit
Standardmäßig lauscht SillyTavern nur auf localhost. Wenn Sie von einem anderen Gerät im Netzwerk darauf zugreifen möchten, aktivieren Sie listen in config.yaml und richten Sie eine Authentifizierung (Basic Auth) ein. Machen Sie die Oberfläche niemals ohne Schutz direkt über das Internet zugänglich.

#Das lokale Backend verbinden

Sobald SillyTavern geöffnet ist, läuft alles über den Tab für die API-Verbindung (das Steckersymbol oben). Das Prinzip: einerseits das Backend starten, andererseits dessen Adresse in SillyTavern angeben.

#Mit KoboldCpp

Starten Sie KoboldCpp mit Ihrem GGUF-Modell; standardmäßig wird seine API auf dem Port 5001 verfügbar gemacht. In SillyTavern wählen Sie den API-Typ „Text Completion“ aus, dann den Backend-Typ „KoboldCpp“ und geben Sie die URL ein. Klicken Sie auf Connect: Der Name des geladenen Modells wird angezeigt, wenn alles korrekt ist.

Terminal
# Lancer KoboldCpp avec un modèle et 8k de contexte
./koboldcpp --model mon-modele-rp.Q4_K_M.gguf --contextsize 8192

# API disponible sur http://localhost:5001
# Dans SillyTavern : API = Text Completion > KoboldCpp
# URL = http://localhost:5001

#Mit Ollama

Ollama läuft bereits als Daemon auf dem Port 11434. In SillyTavern wählen Sie „Text Completion“ aus, dann den Backend-Provider „Ollama“, geben Sie die Adresse ein und wählen Sie das Modell aus der automatisch abgerufenen Dropdown-Liste.

Terminal
# Vérifier qu'Ollama tourne et lister les modèles
ollama list

# Le daemon écoute sur http://localhost:11434
# Dans SillyTavern : API = Text Completion > Ollama
# URL = http://localhost:11434
!
Die richtige Anweisungsvorlage ist entscheidend
Jede Modellfamilie erwartet ein bestimmtes Format (ChatML für Qwen 3.5/3.8 und gpt-oss, Gemma für Gemma 4, Mistral für Mistral Small …). Wenn die Antworten inkonsistent, abgeschnitten oder voller sichtbarer Tags sind, liegt das fast immer an einem falsch gewählten Template. Stellen Sie es im Tab Advanced Formatting so ein, dass es zum geladenen Modell passt.

#Erstellen und Importieren von Charakterkarten

Die Charakterkarte ist das Herz von SillyTavern. Es handelt sich um eine PNG-Datei, deren Bild als Avatar dient und deren eingebundene Metadaten den Charakter beschreiben. Sie können eine solche Karte von Grund auf erstellen oder eine von der Community geteilte Karte importieren.

#Die relevanten Felder

Beschreibung
Die Grundlage der Figur: Aussehen, Charakterzüge, Vorgeschichte. Diese Angaben werden dauerhaft in den Kontext eingefügt. Formulieren Sie daher kompakt und konkret statt weitschweifig.
Personality
Eine Zusammenfassung des Temperaments. Hilfreich, um den Ton festzulegen, ohne die gesamte Beschreibung neu zu schreiben.
First message
Die Begrüßungsnachricht, die die Szene vorgibt. Sie gibt den erwarteten Ton, Schreibstil und das erwartete Format vor — das Modell neigt dazu, ihre Form nachzuahmen.
Example dialogues
Beispiele für Äußerungen, die dem Modell zeigen, wie die Figur spricht. Sehr wirksam, um einen bestimmten Sprachstil festzulegen.
Scenario
Der Szenenkontext, getrennt von der Charakterbeschreibung. Praktisch, um denselben Charakter in verschiedenen Situationen zu verwenden.
  1. 01
    Das Charakter-Panel öffnen
    Das Charaktersymbol in der oberen Leiste öffnet die Liste. Die Schaltfläche „+“ erstellt eine leere Karte.
  2. 02
    Beschreibung eintragen
    Beschreiben Sie die Figur kompakt und detailreich. Viele Autoren verwenden ein strukturiertes Format (Listen von Eigenschaften) statt eines Absatzes; damit kommen die Modelle gut zurecht.
  3. 03
    Die erste Nachricht schreiben
    Gestalten Sie ihn sorgfältig: Er ist Ihr wichtigster Hebel für den Stil. Eine erzählerische Begrüßungsnachricht in der dritten Person lenkt das Modell in Richtung dieses Formats.
  4. 04
    Eine bestehende Karte importieren
    Ziehen Sie eine Karte im PNG-Format in die Liste oder importieren Sie sie. Karten werden auf Community-Hubs als einfache Bilddateien geteilt.
→
Das Tokenbudget des Charakters
Alles, was die Karte enthält, belegt bei jeder Nachricht Platz im Kontext. Eine Beschreibung mit 2.000 Tokens verbraucht bei einem Kontext von 8k bereits ein Viertel des Budgets, noch bevor der Gesprächsverlauf hinzukommt. Fassen Sie sich kurz: Qualität geht vor Länge.

#Die persistente Welt: das Lorebook

Das Lorebook (oder World Info) löst das zentrale Problem langer Spielrunden: Wie hält man eine Welt konsistent, ohne ständig alle Informationen einzuspeisen? Das Prinzip ist die bedingte Einspeisung anhand von Schlüsselwörtern.

Sie erstellen Einträge, die jeweils mit einem oder mehreren Schlüsselwörtern verknüpft sind. Sobald eines dieser Wörter in den letzten Nachrichten vorkommt, wird der entsprechende Eintrag direkt vor der Generierung in den Kontext eingefügt. Ansonsten nimmt er keinen Platz ein. So können Sie Dutzende von Orten, Nebenfiguren und Regeln beschreiben, ohne den Prompt jemals zu überlasten.

Eingabe
Ein Textblock (die einzufügende Lore) und seine auslösenden Schlüsselwörter. Beispiel: Schlüsselwort „Valmont“ → Beschreibung der Stadt Valmont.
Konstant vs. selektiv
Ein Eintrag kann immer aktiv sein (grundlegende Regeln der fiktionalen Welt) oder nur durch ein Schlüsselwort aktiviert werden (kontextbezogene Details).
Injektionstiefe
Sie wählen, an welcher Position der Eintrag in den Prompt eingefügt wird. Das beeinflusst, wie stark das Modell ihn gewichtet.
An einen Charakter gebunden oder global
Ein Lorebook kann einer bestimmten Karte zugeordnet sein oder als gemeinsames Universum für alle Ihre Gespräche gelten.
i
Lorebook ≠ RAG
Die schlüsselwortbasierte Einfügung ist einfacher und besser vorhersehbar als eine Vektorsuche: Sie wird durch eine Textübereinstimmung ausgelöst, nicht durch semantische Ähnlichkeit. Für eine strukturierte fiktive Welt ist sie oft zuverlässiger als klassisches RAG und bleibt vollständig unter Ihrer Kontrolle.

#Die Generierung für das Rollenspiel einstellen

Die Sampling-Parameter bestimmen das Verhältnis zwischen Kohärenz und Kreativität. Bei Rollenspielen ist mehr Vielfalt gefragt als bei sachlicher Unterstützung, ohne dass die Antworten inkohärent werden. Diese Einstellungen finden Sie auf der Registerkarte für die Generierungseinstellungen (Symbol mit Schiebereglern).

Temperatur
Der Regler für Kreativität und Stabilität. Etwa 0,7–0,9 sorgen für ein gutes Gleichgewicht beim Rollenspiel. Zu hohe Werte (> 1,2) führen zu Inkohärenz; zu niedrige Werte machen den Charakter repetitiv und eindimensional.
Min-P
Ein moderner Sampler, der unwahrscheinliche Tokens anhand ihrer Wahrscheinlichkeit im Verhältnis zum wahrscheinlichsten Token ausschließt. Ein Wert von 0,05 bis 0,1 bereinigt die Ausgabe und erlaubt es, die Temperatur zu erhöhen, ohne dass die Ausgabe aus dem Ruder läuft.
Wiederholungsstrafe
Bestraft die Wiederholung derselben Tokens. Hilfreich gegen Schleifen, zwingt das Modell bei zu hoher Einstellung aber zu künstlichen Formulierungen. Wählen Sie einen moderaten Wert.
Response length
Die maximale Anzahl generierter Tokens pro Antwort. 200–400 Tokens für gehaltvolle erzählerische Antworten ohne endlose Monologe.
Context size
Muss der Kontextgröße entsprechen, die Ihr Backend geladen hat. Es ist sinnlos, in SillyTavern 16k anzufordern, wenn KoboldCpp nur mit 8k gestartet wurde.
→
Mit einem Preset beginnen, bevor man herumprobiert
SillyTavern stellt einsatzbereite Sampling-Presets bereit. Laden Sie ein für RP geeignetes Preset, spielen Sie eine Szene und passen Sie anschließend jeweils nur einen Parameter an. Wenn Sie fünf Schieberegler gleichzeitig ändern, wird jede Diagnose unmöglich.

#Erweiterungen, die das Nutzungserlebnis verändern

SillyTavern ist erweiterbar. Einige Erweiterungen sind standardmäßig enthalten, andere werden über ihre Repository-URL installiert. Folgende Erweiterungen verändern das Nutzungserlebnis wirklich.

Vector Storage (Gedächtniszusammenfassung)
Vektorisiert den Verlauf und fügt relevante Passagen aus alten Nachrichten wieder ein, wodurch das Gedächtnis über das Kontextfenster hinaus erweitert wird. Nützlich für sehr lange Spielrunden.
Summarize
Erstellt eine fortlaufende Zusammenfassung des Gesprächs, hält sie aktuell und fügt sie wieder in den Prompt ein. Die Figur erinnert sich auch nach Hunderten von Nachrichten an die wichtigsten Ereignisse.
Text-to-Speech
Gibt den Charakteren über eine lokale TTS-Engine eine Stimme. Mehr Immersion für alle, die beim Spielen sprechen.
Image generation
Verbindet sich mit einem lokalen Bild-Backend (z. B. Stable Diffusion), um direkt aus dem Chat heraus spontan Szenen und Figuren zu illustrieren.
Gesichtsausdrücke
Zeigt den Avatar mit einem zum Ton der Nachricht passenden Gefühlsausdruck an, basierend auf einem Sprite-Set der Figur.
i
Jede Erweiterung kostet Tokens oder VRAM
Summarize und Vector Storage verbrauchen Kontext; Bildgenerierung und TTS benötigen eigene Modelle und damit zusätzlich zu Ihrem LLM auch VRAM oder CPU-Ressourcen. Aktivieren Sie sie entsprechend Ihrem Hardwarebudget, nicht alle auf einmal.

#Welche lokalen Modelle eignen sich besonders gut für Rollenspiele?

Nicht alle LLMs eignen sich gleichermaßen für Rollenspiele. „Instruct“-Modelle, die auf Assistenzaufgaben ausgerichtet sind, neigen dazu, aus der Rolle zu fallen, zu moralisieren oder fiktionale Szenarien abzulehnen. Die Community bevorzugt spezialisierte Fine-Tunes, die oft auf soliden Basismodellen aufbauen und anschließend für das Erzählen von Geschichten und Dialoge in der jeweiligen Rolle weitertrainiert werden.

Sinnvolle Modellgröße
Unter 4B leidet die Konsistenz der Figur auf Dauer. 2026 bietet eine aktuelle Basis wie Qwen 3.5 9B (~6,6 GB, 256k Kontext) oder Gemma 4 12B (~7,6 GB, Apache 2.0) den besten Kompromiss für die meisten Grafikkarten der Mittelklasse. Eine Stufe darüber passt Mistral Small 24B (~14 GB, besonders gut auf Französisch) in 16 GB und bietet mehr erzählerische Feinheit.
RP-Fine-Tunes
Suchen Sie nach Modellen, die ausdrücklich für Rollenspiele oder fiktionale Texte trainiert wurden (auf Hugging Face häufig mit „RP“, „storytelling“ oder „uncensored“ gekennzeichnet). Die besten Fine-Tunes von 2026 basieren auf diesen neueren Basismodellen (Qwen 3.5, Mistral Small 24B, Gemma 4) statt auf den alten Modellen Llama 2 oder Mistral 7B von 2023; sie halten sich besser an das Format der Karten.
Langer Kontext
Bevorzugen Sie ein Modell, das auch bei 16k+ Tokens stabil bleibt, ohne qualitativ abzubauen: Lange Spielsitzungen erfordern das. Prüfen Sie das angegebene native Kontextfenster des Modells.
GGUF-Format
Bleiben Sie für KoboldCpp bei quantisierten GGUF-Modellen. Q4_K_M ist der empfohlene Kompromiss; wechseln Sie zu Q5_K_M oder Q8_0, wenn Ihr VRAM es zulässt und Sie feinere Ergebnisse wünschen.
→
Eine Karte mit zwei oder drei Modellen testen
Derselbe Charakter kann mit einem Modell langweilig und mit einem anderen brillant wirken. Bevor Sie zu dem Schluss kommen, dass Ihre Charakterkarte schlecht ist, probieren Sie sie mit einigen verschiedenen RP-Modellen aus: Der Unterschied in der Darstellung ist oft spektakulär.

#Behebung häufiger Probleme

SillyTavern verbindet sich nicht
Prüfen Sie, ob das Backend läuft und der Port stimmt (5001 für KoboldCpp, 11434 für Ollama). Ein Test der API-URL im Browser bestätigt, dass die API antwortet.
Antworten mit sichtbaren Tags
Fast immer liegt es an einer ungeeigneten Instruktionsvorlage. Passen Sie unter Advanced Formatting das Format (ChatML, Gemma, Mistral…) an das des Modells an.
Die Figur fällt aus ihrer Rolle
Ergänzen Sie die Beschreibung und die Dialogbeispiele, senken Sie die Temperatur etwas und prüfen Sie, ob Ihr System-Prompt mit der Charakterkarte im Widerspruch steht.
Wiederholungen und Schleifen
Erhöhen Sie die Wiederholungsstrafe leicht und fügen Sie Min-P hinzu. Wenn das Problem weiterhin besteht, ist das Kontextfenster möglicherweise voll: Aktivieren Sie Summarize oder reduzieren Sie die Größe der Charakterkarte.
Abgeschnittene Antworten
„Response length“ ist zu niedrig eingestellt, oder das Backend wurde mit einem kleineren Kontext gestartet, als SillyTavern anfordert. Stimmen Sie die beiden Werte aufeinander ab.

#Weiterführende Informationen

SillyTavern ist nur eine Schicht: Die endgültige Qualität hängt vor allem von Ihrem Backend und dem Modell ab. Diese Anleitungen helfen, die Grundlagen zu stärken.

KoboldCpp: Installation und erste Schritte
Das Referenz-Backend für lokales RP: GGUF, Speichereinstellungen und eine API, die SillyTavern nativ unterstützt.
Ollama, was ist das und wie funktioniert es?
Die allgemeine Alternative, wenn Sie einen einzigen Daemon auf dem Port 11434 für alle Ihre Anwendungen bevorzugen.
Den KV-Cache quantisieren
Um längere RP-Kontexte auf derselben Grafikkarte unterzubringen, ohne den VRAM zu überlasten.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.