Mittelstufe 13 minKreativ

Einen Roman mit einem lokalen LLM schreiben: Methode und Werkzeuge

Ein Buch mit einer KI zu schreiben bedeutet nicht, sie mit „Schreib mir einen Roman“ aufzufordern und das Ergebnis zu kopieren – dabei kommt nur lauwarmer Brei heraus. Der sinnvolle Einsatz ist die KI als Schreibpartner: ein Modell, das Ihnen hilft, Ihren Text zu strukturieren, bei einer festgefahrenen Szene weiterzukommen und Ihre Figuren über Hunderte von Seiten konsistent zu halten. Dieser Leitfaden zeigt, wie Sie das mit einem lokalen LLM tun, bei dem Ihr Manuskript niemals Ihren Rechner verlässt und kein Stilfilter Ihre Prosa glattbügelt.

Von Léa B.·Aktualisierung 2026-09-16·Unter Windows, macOS und Linux getestet

#Warum ein Buch mit einer lokalen KI statt in der Cloud schreiben?

Ein Roman bedeutet monatelange Arbeit und einen Text, den Sie weder zum Training eines Modells abschöpfen noch ablehnen lassen möchten, weil eine Szene gewalttätig, düster oder sexuell explizit ist. Cloud-Dienste für die breite Öffentlichkeit setzen Inhaltsfilter und Nutzungsrichtlinien ein, die bei Fiktion für Erwachsene oder düsteren Kriminalromanen regelmäßig im ungünstigsten Moment den kreativen Schwung bremsen.

Ein LLM, das auf Ihrem eigenen Rechner läuft, löst beide Probleme auf einmal. Der Text bleibt auf Ihrer Festplatte: Kein Entwurf und kein Spoiler zu Ihrer Handlung gelangt an Dritte. Und Sie wählen das Modell — einschließlich Versionen ohne stilistische Einschränkungen, die die gewünschte Szene schreiben, ohne Moralpredigt oder Ablehnung. Ein nicht zu unterschätzender Vorteil bei einem langen Projekt: kein monatliches Abonnement und kein Token-Zähler, der weiterläuft, während Sie Kapitel 12 zum zehnten Mal den letzten Schliff geben.

Vollständige Vertraulichkeit
Ihr Manuskript, Ihre Notizen und Ihre Handlung bleiben lokal. Kein Inhalt dient dem Training eines Drittmodells.
Kein Stilfilter
Belletristik für Erwachsene, Horror, schonungslose Thriller: Das Modell schreibt, was die Szene verlangt, ohne moralische Blockaden.
Fixkosten
Sobald sich die Hardware amortisiert hat, können Sie so viele Entwürfe generieren, wie Sie möchten, ohne nutzungsabhängige Gebühren.
Offline verfügbar
Im Zug oder in einer Hütte ohne Netz schreiben, ohne auf eine Verbindung angewiesen zu sein.

#Voraussetzungen: Hardware und Softwarestack

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Kreatives Schreiben benötigt weniger Rechenressourcen als Programmieren: Sie brauchen nicht das größte Modell auf dem Markt, sondern ein Modell, das Französisch gut beherrscht und den Ton beibehält. Eine GPU mit 12 GB (RTX 3060 12GB, RTX 4070) kann bereits ein 12B–14B-Modell in Q4_K_M problemlos ausführen, was für Prosa die passende Größenklasse ist. Mit 16 GB (RTX 4080) können Sie ein 24B-Modell nutzen, und 24 GB (RTX 4090) oder ein Mac M4 Pro mit gemeinsamem Speicher ermöglichen 32B-Modelle, die bei langen Szenen deutlich nuancierter arbeiten.

3B (~2 GB VRAM)
Schnelle Hilfe, Umformulierungen. Zu kurz, um einen einheitlichen Ton über ein ganzes Kapitel hinweg beizubehalten.
7B (~5 GB)
Für Brainstorming und kurze Szenen auf einem kleinen System mit 8 GB geeignet.
14B (~9 GB)
Der ausgewogene Kompromiss für eine GPU mit 12 GB: ordentliche Prosa auf Französisch, gutes Gedächtnis für den Kontext.
32B (~19 GB)
Der beste Kompromiss zwischen Qualität und lokalem Betrieb für ein ernsthaftes Romanprojekt, ab 24 GB VRAM oder mit einem Mac mit gemeinsam genutztem Speicher.

Auf der Softwareseite bleibt die einfachste Kombination Ollama als Daemon (der unter http://localhost:11434 lauscht) zusammen mit einer Benutzeroberfläche. Open WebUI oder LM Studio eignen sich für laufende Gespräche; für ein richtiges Schreibprojekt erleichtert eine auf Figuren und dauerhaft erhaltenen Kontext ausgelegte Oberfläche wie SillyTavern die Arbeit enorm (siehe „Weiterführende Informationen“).

Terminal — Ollama installieren und ein kreatives Modell herunterladen
# Linux / macOS
curl -fsSL https://ollama.com/install.sh | sh

# Un modèle solide en français, quantifié Q4_K_M
ollama pull mistral-small

# Vérifier qu'il répond
ollama run mistral-small "Écris la première phrase d'un polar qui se passe à Marseille."

#Welche lokalen Modelle schreiben am besten auf Französisch?

Nicht alle Modelle sind beim Verfassen literarischer Texte auf Französisch gleich gut. Viele wurden überwiegend mit englischen Texten trainiert und erzeugen korrekte, aber flache Prosa mit aus dem Englischen übernommenen Wendungen („Elle prit une profonde respiration“). Bevorzugen Sie für fiktionale Texte Modelle, die für ihre Mehrsprachigkeit bekannt sind, und Varianten, die für das Schreiben feinabgestimmt wurden.

Mistral Small (24B)
Aus Frankreich, hervorragend in idiomatischem Französisch. Die erste Wahl für einen Roman; hält den Ton auch über längere Texte hinweg gut bei.
Gemma (12B–27B)
Gute Prosa, eher flexibler Stil; das 27B-Modell ist bei Dialogen durchaus gut, wenn Sie genügend VRAM haben.
Qwen (14B–32B)
Sehr leistungsfähig, komfortabel bei langem Kontext; das Französisch ist gut, klingt aber manchmal weniger „natürlich“ als bei Mistral.
Kreative Varianten mit Fine-Tuning
Auf Ollama und Hugging Face schreiben abgeleitete Modelle vom Typ „writer“ / „storyteller“ oder unzensierte Varianten Szenen, die die Basismodelle ablehnen. Je nach Ihrem Genre ausprobieren.
→
Testen Sie, bevor Sie sich festlegen
Geben Sie zwei oder drei Modellen dieselbe Testpassage (eine angespannte Dialogszene, einen beschreibenden Absatz) und vergleichen Sie die Ergebnisse nach ihrem Klang. Die „beste“ Prosa ist subjektiv: Das Modell, das zu Ihrer eigenen Stimme passt, zählt mehr als das, das die Benchmarks gewinnt.
i
Der Kontext – der entscheidende Faktor
Für einen Roman ist die Größe des Kontextfensters ebenso wichtig wie die Qualität der Prosa: Sie bestimmt, wie viel Text das Modell auf einmal „sieht“. Streben Sie mindestens 16k–32k nutzbare Kontexttokens an und halten Sie zusätzlich zum Speicher für die Modellgewichte VRAM für diesen Kontext frei.

#Eine Methode, die Kapitel für Kapitel funktioniert

Der Anfangsfehler besteht darin, den gesamten Roman zu verlangen. Ein LLM verfügt über keine Gesamtsicht; er ist hervorragend bei kurzen, klar abgegrenzten Aufgaben. Die funktionierende Methode geht vom Allgemeinen zum Besonderen Schicht für Schicht vor, wobei die Struktur stets im Auge behalten bleibt. Sie bleiben der Autor; der Modell ist ein Drehbuchschreiber und ein Erstentwurf, dem Sie den Weg vorschreiben.

  1. 01
    1. Der Pitch und das Thema
    Formulieren Sie in zwei Sätzen das Thema, das Genre und das zentrale Anliegen der Geschichte. Bitten Sie das Modell um drei oder vier Varianten eines Aufhängers, um die passende Perspektive zu finden, und legen Sie dann Ihren eigenen fest. Er dient Ihnen als Kompass für alles Weitere.
  2. 02
    2. Die Gliederung in Akte und anschließend in Kapitel
    Bitten Sie um eine Gliederung in 3 Akte und entwickeln Sie anschließend jeden Akt zu Kapiteln weiter, jeweils mit einem Satz zur Zusammenfassung („was passiert“) und einem Satz dazu, was auf dem Spiel steht („was sich ändert“). Sie erhalten eine einseitige Synopsis, die Sie nach Ihrem Geschmack umschreiben.
  3. 03
    3. Das Beat Sheet des Kapitels
    Bevor Sie ein Kapitel schreiben, zerlegen Sie dessen Zusammenfassung in 5 bis 8 „Beats“: die kleinen Handlungsschritte der Szene. Das Modell arbeitet mit einem konkreten Beat („Léa entdeckt den Brief und versteht die Lüge“) wesentlich besser als mit „schreibe Kapitel 4“.
  4. 04
    4. Der erste Entwurf, Beat für Beat
    Generieren Sie die Prosa jeweils für einen einzelnen Beat und geben Sie dabei den aktuellen Beat sowie eine kurze Erinnerung an die anwesenden Figuren an. Korrigieren Sie jede Passage oder lassen Sie sie erneut generieren, bevor Sie zur nächsten übergehen: Sie fügen das Kapitel Stück für Stück zusammen, statt es in einem einzigen Block auszugeben.
  5. 05
    5. Der Überarbeitungsdurchgang
    Sobald das Kapitel von Hand und mit maschineller Unterstützung geschrieben ist, bitten Sie das Modell um eine gezielte Durchsicht: „Erkenne Wiederholungen“, „straffe die Dialoge“, „weise auf Unstimmigkeiten im zeitlichen Ablauf hin“. Übernehmen Sie niemals blind eine vollständige Neufassung.
!
Das Modell hat keinen Geschmack, Sie schon
Ein LLM erzeugt schnell „akzeptablen“, aber faden Text. Wenn Sie alles übernehmen, was es vorschlägt, bekommt Ihr Roman eine generische Stimme. Behandeln Sie jede Ausgabe wie den Entwurf eines Assistenten: Behalten Sie die Idee und formulieren Sie sie mit Ihren eigenen Worten neu. Die Stimme kommt von Ihnen.

#Figurenprofile und Weltenbibel

Die Konsistenz eines Romans beruht auf einer „Bibel“: einem Referenzdokument, das Sie und das Modell ständig konsultieren. Ohne sie hat Ihre Heldin in Kapitel 2 grüne und in Kapitel 18 blaue Augen, und das Café um die Ecke ändert seinen Namen. Erstellen Sie dieses Dokument bereits beim Entwerfen des Handlungsplans und ergänzen Sie es nach und nach.

Figurensteckbrief
Name, Alter, Aussehen anhand von 3 Merkmalen, Stimme/sprachliche Eigenheiten, Ziel, innere Wunde, Entwicklungsbogen. Eine halbe Seite pro Hauptfigur.
Weltenbibel
Wiederkehrende Schauplätze, Regeln der Welt (bei Science-Fiction/Fantasy), Chronologie der Ereignisse, wichtige Gegenstände.
Stilglossar
Zwei oder drei Beispielsätze für die „Stimme des Buches“, die Sie am Anfang des Prompts einfügen, um den Stil in jeder Sitzung abzustimmen.
Kontinuitätsprotokoll
Eine Zeile pro Kapitel: was jede Figur zu diesem Zeitpunkt der Geschichte weiß. Verhindert Enthüllungen, die zu früh oder zweimal erfolgen.
Beispiel – fiche-personnage.md
# Léa Vasseur
- Âge : 34 ans, journaliste d'investigation à Marseille
- Apparence : cheveux courts châtains, cicatrice au sourcil gauche, toujours en veste militaire
- Voix : phrases courtes, ironie sèche, jure quand elle est acculée
- Objectif : prouver l'innocence de son frère
- Blessure : culpabilité de ne pas l'avoir cru à l'époque
- Arc : de la méfiance systématique vers la capacité à faire confiance
- Sait au ch.4 : que la lettre existe. Ignore encore : qui l'a écrite.

In der Praxis fügen Sie das relevante Figurenprofil oder die relevanten Figurenprofile am Anfang Ihres Prompts ein, bevor Sie eine Szene schreiben („Hier sind die Figuren, die in der Szene vorkommen … schreib jetzt den nächsten Beat“). Das ist manuelles RAG: Sie fügen den nützlichen Kontext zum richtigen Zeitpunkt ein, statt darauf zu hoffen, dass sich das Modell „erinnert“.

#Konsistenz auf 300 Seiten beibehalten

Hier liegt die eigentliche technische Herausforderung. Ein Roman mit 300 Seiten umfasst etwa 120.000 Wörter, also ungefähr 180.000 Tokens – weit mehr, als in das Kontextfenster irgendeines lokalen Modells passt. Das Modell kann nicht Ihr gesamtes Buch „gelesen haben“. Die Kohärenz ergibt sich daher nicht aus seinem Gedächtnis, sondern aus Ihrer Disziplin, ihm für jede Szene erneut den richtigen Kontext zu geben.

Kaskadierte Zusammenfassungen
Führen Sie für jedes Kapitel eine Zusammenfassung in einem Satz. Bevor Sie Kapitel N schreiben, stellen Sie die Zusammenfassungen der vorherigen Kapitel statt ihres vollständigen Textes bereit: Zehn Zeilen reichen aus, um die Handlung einzuordnen.
Gleitendes Fenster
Geben Sie dem Modell den vollständigen Text der vorherigen 1 bis 2 Kapitel (für den Ton und die Übergänge) sowie die Zusammenfassungen aller übrigen Kapitel. So wahren Sie die Kontinuität zu den unmittelbar vorhergehenden Kapiteln, ohne das Kontextfenster zu überlasten.
Story-Bibel am Anfang des Prompts
Immer die Profile der Figuren, die in der Szene vorkommen. So werden Unstimmigkeiten bei Details verhindert.
Zielgerichtete Prüfungen
Lassen Sie das Modell regelmäßig ein Kapitel mit einer gezielten Frage gegenlesen: „Gibt es einen Widerspruch zu dieser Zusammenfassung der Handlung?“ Es erkennt sachliche Fehler gut, wenn die Frage klar eingegrenzt ist.
i
Zusammenfassen heißt komprimieren
Ihr Zusammenfassungsjournal ist ein komprimierter Index Ihres Romans. Je präziser es ist (wer was weiß und wie weit die einzelnen Nebenhandlungen fortgeschritten sind), desto konsistenter bleibt das Modell. Aktualisieren Sie es am Ende jedes Kapitels, niemals später: Diese fünf Minuten ersparen Ihnen Stunden an Nacharbeit.

#Kreativitätsparameter: Temperatur und Sampling

Die Sampling-Parameter verändern das Ergebnis grundlegend. Bei fiktionalen Texten sucht man Vielfalt und Überraschungen, ohne dass der Text inkohärent wird. Die Temperatur ist der wichtigste Stellhebel: Niedrige Werte (0,3–0,6) ergeben zurückhaltende, vorhersehbare Prosa, die für technische Passagen oder Zusammenfassungen nützlich ist; hohe Werte (0,8–1,1) geben der Fantasie mehr Freiraum, erhöhen aber das Risiko von Abschweifungen.

Temperatur 0,8–1,0
Der passende Bereich für erzählende Prosa: lebendig, ohne zusammenhanglos zu werden. Senken Sie den Wert für Zusammenfassungen und Steckbriefe auf 0,5.
top-p 0,9–0,95
Erhält eine gute Vielfalt im Wortschatz und schließt zugleich wirklich unwahrscheinliche Optionen aus.
Wiederholungsstrafe ~1,1
Gegen die Angewohnheit von LLMs, immer dieselben Formulierungen zu verwenden. Nicht zu hoch einstellen, sonst wird der Stil künstlich.
Antwortlänge
Begrenzen Sie die Generierung auf die Länge eines Beats oder einer Szene; sehr lange Ausgaben schweifen ab und verlieren den roten Faden.
Ollama – Generierungsoptionen für fiktionale Texte
{
  "model": "mistral-small",
  "prompt": "[fiches + beat]",
  "options": {
    "temperature": 0.9,
    "top_p": 0.92,
    "repeat_penalty": 1.1,
    "num_ctx": 16384
  }
}

#Häufige Fehler und Troubleshooting

Klar erkennbare KI-Texte
Sprachliche Muster wie „ein Schauer lief ihm über den Rücken“ oder „egal, was ihn erwartete“. Verbieten Sie diese ausdrücklich im Prompt und schreiben Sie die verräterischen Formulierungen von Hand um.
Das Modell fasst zusammen, statt zu schreiben
Das Modell handelt eine Szene in drei Sätzen ab. Fordern Sie ausdrücklich „Zeigen statt Erzählen“, Szene für Szene, mit Dialogen und Sinneseindrücken.
Den roten Faden mitten im Kapitel verlieren
Ein Zeichen dafür, dass das Kontextfenster überschritten wird. Verkürzen Sie die Szenen, erhöhen Sie num_ctx, wenn der VRAM es zulässt, oder beginnen Sie mit einer sauberen Zusammenfassung neu.
Verweigerung oder Abschwächung
Ein Basismodell schränkt die Darstellung einer harten Szene ein. Wechseln Sie zu einer für kreatives Schreiben feinabgestimmten Variante oder formulieren Sie die Anfrage um und machen Sie dabei den fiktionalen Kontext deutlich.
Alle Charaktere sprechen gleich
Fügen Sie das „Stimmenprofil“ jeder Figur ein und verlangen Sie Dialoge mit unterscheidbaren Stimmen; lesen Sie sie zur Kontrolle laut vor, um Gleichförmigkeit zu erkennen.

#Weiterführende Informationen

Um diese Methode zu einer komfortablen Schreibwerkstatt auszubauen, führen drei Leitfäden dieser Website den vorliegenden Leitfaden weiter. SillyTavern bietet eine Benutzeroberfläche für dauerhaft angelegte Figuren und lange Kontexte, ideal zum Verwalten von Figurenprofilen und Szenen, ohne alles immer wieder von Hand zusammenkopieren zu müssen. Der Leitfaden zu Temperatur und Sampling erklärt im Detail, wie Sie die Kreativität Ihres Modells präzise dosieren. Und wenn Sie bei Hardware und Installation bei null anfangen, hilft Ihnen der Leitfaden zur Installation eines lokalen LLM, den Ollama-Stack sauber einzurichten, bevor Sie mit Ihrem Roman beginnen.


Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.