Einsteiger 9 Min.Konzepte

Halluzinationen: Warum Ihr lokaler LLM erfindet und wie limiter

Eine KI-Halluzination ist eine falsche Antwort, die mit der Sicherheit einer richtigen Antwort formuliert wird: ein erfundenes Datum, ein nicht existierendes Zitat, eine imaginäre Python-Funktion. Bei einem lokalen LLM tritt dasselbe Phänomen auf wie bei großen Cloud-Modellen, manchmal stärker bei Quantisierungen mit geringer Bitbreite. Dieser Leitfaden erklärt ohne Fachjargon, woher diese Erfindungen kommen, und führt anschließend konkrete Einstellungen, Prompts und Schutzmaßnahmen auf, um sie zu reduzieren – und vor allem die Fälle, in denen man der Maschine niemals vertrauen sollte.

Von Clara M.·Aktualisierung 2026-08-03·Unter Windows, macOS und Linux getestet

#Was ist eine Halluzination?

Der Begriff „Halluzination“ bezeichnet jede vom Modell erzeugte Aussage, die falsch, erfunden oder nicht überprüfbar ist, aber als Tatsache dargestellt wird. Es handelt sich nicht um einen Bug im informatischen Sinne: Das Programm funktioniert einwandfrei und erzeugt plausiblen Text. Das Problem ist, dass „plausibel“ und „wahr“ nicht dasselbe sind.

Konkret kann eine Halluzination verschiedene Formen annehmen: eine präzise, aber falsche Zahl („Die Einwohnerzahl dieser Stadt beträgt 47.312“), eine Quelle, die nicht existiert („laut der Studie von Dupont et al., 2019“), eine erfundene API oder ein erfundener Befehl (`ollama sync --cloud`) oder eine Mischung aus echten Elementen, die falsch miteinander kombiniert wurden. Allen gemeinsam ist der stets selbstsichere Ton.

i
Das ist keine Lüge
Das Modell hat nicht die Absicht, zu täuschen. Es hat nicht einmal eine Vorstellung davon, was wahr oder falsch ist. Es sagt das wahrscheinlichste nächste Wort voraus. Wenn Wahrheit und Wahrscheinlichkeit auseinandergehen, gewinnt die Wahrscheinlichkeit.

#Warum das Modell Dinge erfindet

Das Kit Lokale KI

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Ein LLM wird auf eine einzige Aufgabe trainiert: die statistisch wahrscheinliche Textfortsetzung. Es hat Milliarden von Sätzen aufgenommen und daraus Regelmäßigkeiten abgeleitet. Wenn Sie eine Frage stellen, „konsultiert“ es keine Knowledge-Base: es erzeugt Wort für Wort die wahrscheinlichste Fortsetzung basierend auf Ihrer Anfrage und seinem Training.

Kein zuverlässiges Faktengedächtnis
Das Wissen ist über die Gewichte des Netzwerks verteilt und nicht wie in einer Datenbank gespeichert. Das Modell „erinnert sich“ an eine Tendenz, nicht an eine exakte Tatsache. Präzise Details (Datumsangaben, Zahlen, seltene Eigennamen) werden als Erstes verfälscht.
Ein Training mit festem zeitlichem Wissensstand
Das Modell kennt nichts aus der Zeit nach dem Stichtag seiner Trainingsdaten. Wird es zu einem aktuellen Ereignis befragt, sagt es nicht „Ich weiß es nicht“: Es extrapoliert aus dem, was es kennt, und erfindet dabei Inhalte.
Die Tendenz, eine Antwort zu geben
Ein LLM ist darauf optimiert, zu antworten, nicht zu schweigen. Bei einer Frage, deren Antwort es nicht kennt, ist die wahrscheinlichste Fortsetzung oft eine selbstsicher formulierte Antwort statt eines Eingeständnisses, die Antwort nicht zu wissen.
Der Effekt der Quantisierung
Ein Modell mit Q4_K_M zu komprimieren spart VRAM, verringert aber die Genauigkeit leicht. Bei anspruchsvollen faktenbezogenen Aufgaben kann eine aggressive Quantisierung die Häufigkeit erfundener Angaben gegenüber Q8_0 oder FP16 erhöhen.
Der Zufall beim Sampling
Bei jedem Wort wählt das Modell zufällig unter den wahrscheinlichen Kandidaten aus. Je „kreativer“ diese Auswahl ist (hohe Temperatur), desto eher kann das Modell zu unwahrscheinlichen – und damit falschen – Fortsetzungen abdriften.

Mit anderen Worten: Halluzinationen sind kein zufälliges Missgeschick, sondern Teil der normalen Funktionsweise eines Systems, das plausibel klingenden Text erzeugt, ohne Zugang zur Wahrheit zu haben. Man beseitigt sie nicht, sondern reduziert und kontrolliert sie.

#Eine erfundene Aussage erkennen

Bevor man etwas korrigieren kann, muss man es erkennen können. Bestimmte Signale sollten Sie sofort hellhörig machen.

Eine verdächtige Genauigkeit
Zahlen bis auf die letzte Einheit, exakte Datumsangaben, präzise Prozentwerte zu einem Nischenthema: Je präziser die Angaben ohne Quelle sind, desto zweifelhafter sind sie.
Zitate und Links
Artikeltitel, Autorennamen, URLs, Seitenzahlen, rechtliche Verweise. LLMs erfinden Quellen, die vollkommen glaubwürdig wirken. Keine von einem Modell erzeugte Referenz darf ohne Überprüfung als echt angesehen werden.
Code, der existieren „sollte“
Namen von Funktionen oder Kommandozeilenoptionen, die plausibel erscheinen, aber nicht existieren. Das Modell ergänzt sie analog zu ähnlichen APIs.
Eine Antwort, die sich ändert
Stellen Sie in einer neuen Unterhaltung noch einmal exakt dieselbe Frage. Wenn die Antwort auf die Sachfrage von Mal zu Mal variiert, rät das Modell, statt die Antwort zu wissen.
→
Der Umformulierungstest
Fragen Sie das Modell „Bist du sicher? Nenne deine genaue Quelle“ oder stellen Sie die Frage anders. Eine belastbare Tatsache hält stand; bei einer erfundenen Aussage treten oft Widersprüche auf, oder sie endet in „Ich kann das nicht bestätigen“.

#Einstellungen, die erfundene Angaben reduzieren

Die Generierungsparameter bestimmen den Kompromiss zwischen Kreativität und Zuverlässigkeit. Bei allem, was Fakten, Code oder die Extraktion von Informationen betrifft, ist ein deterministisches und vorsichtiges Vorgehen erwünscht.

temperature
Die wichtigste Stellschraube. Bei 0 wählt das Modell immer das wahrscheinlichste Wort: stabile und konservative Antworten. Erhöhen Sie den Wert für kreatives Schreiben auf 0,7–1,0, senken Sie ihn jedoch für faktenbasierte Aufgaben auf 0,1–0,3.
top_p
Beschränkt die Zufallsauswahl auf Kandidaten, deren Wahrscheinlichkeiten zusammen einen vorgegebenen Wert ergeben. Ein niedriger Wert (0,1–0,5) schließt den langen Ausläufer unwahrscheinlicher Wörter aus, die häufig für Entgleisungen verantwortlich sind.
top_k
Begrenzt die Anzahl der Kandidaten, die bei jedem Schritt berücksichtigt werden. Ein niedriger top_k-Wert (10–20) schränkt den Spielraum ein, in dem das Modell vom richtigen Kurs abkommen kann.
seed
Ein fester Seed macht die Generierung reproduzierbar: Bei identischen Einstellungen entsteht dieselbe Ausgabe. Unverzichtbar, um zu testen, ob eine Antwort stabil oder zufällig ist.
num_ctx
Die Kontextgröße. Ist sie zu klein, „vergisst“ das Modell den Anfang und kann Textfragmente falsch miteinander kombinieren. Stellen Sie sicher, dass Ihre Referenzdokumente in das Kontextfenster passen.

Mit Ollama lassen sich diese Einstellungen direkt beim API-Aufruf übergeben oder in einem Modelfile festlegen. Hier ein Beispiel für einen vorsichtigen, auf Fakten ausgerichteten Aufruf an den lokalen Daemon:

Terminal
curl http://localhost:11434/api/generate -d '{
  "model": "qwen3.5:9b",
  "prompt": "Résume ce texte sans rien ajouter : ...",
  "stream": false,
  "options": {
    "temperature": 0.2,
    "top_p": 0.5,
    "top_k": 20,
    "seed": 42
  }
}'

Um diese Einstellungen für ein Modell dauerhaft festzulegen, trägt man sie in ein Modelfile ein und erstellt eine eigene Variante für faktenbezogene Aufgaben:

Modelfile
FROM mistral
PARAMETER temperature 0.2
PARAMETER top_p 0.5
PARAMETER top_k 20
SYSTEM "Tu réponds uniquement à partir des informations fournies. Si tu ne sais pas, tu dis 'Je ne sais pas'. Tu n'inventes jamais de source, de chiffre ni de citation."
Terminal
ollama create mistral-prudent -f ./Modelfile
ollama run mistral-prudent
!
Niedrige Temperatur ≠ garantierte Wahrheit
Eine niedrigere Temperatur macht die Antwort stabil und konservativ, aber nicht korrekt. Ein Modell kann bei Temperatur 0 vollkommen deterministisch halluzinieren. Die Einstellungen reduzieren das Rauschen; sie erzeugen kein Wissen, das nicht vorhanden ist.

#Prompts für vorsichtige Antworten

Wie Sie Ihre Anfrage formulieren, beeinflusst stark, wie häufig das Modell Informationen erfindet. Die Idee: Nichtwissen ausdrücklich zulassen und das Erfinden von Informationen verbieten.

Das Recht einräumen, etwas nicht zu wissen
„Wenn du dir nicht sicher bist, antworte: Ich weiß es nicht.“ Ohne diese Erlaubnis füllt das Modell die Lücke mit einer Erfindung.
Bindung an den vorgegebenen Kontext verlangen
„Antworten Sie ausschließlich auf Grundlage des folgenden Textes. Verwenden Sie kein externes Wissen.“ Damit wird das Modell gezwungen, sich auf den bereitgestellten Kontext zu beschränken.
Die Quellen im Text anfordern
„Zitieren Sie für jede Behauptung den genauen Satz aus dem Dokument, der sie belegt.“ Wenn das Modell keinen Beleg findet, wird sichtbar, dass dieser fehlt.
Fakten und Annahmen trennen
„Unterscheide das, was feststeht, von dem, was eine Annahme deinerseits ist.“ Dadurch wird das Modell dazu angehalten, seine eigenen Unsicherheiten zu kennzeichnen.
Komplexe Aufgaben aufteilen
Eine Frage in mehreren klaren Schritten lässt weniger Raum für Improvisation als eine große offene Frage.
System-Prompt gegen Halluzinationen
Tu es un assistant factuel et prudent.
Règles :
1. Réponds uniquement à partir du contexte fourni par l'utilisateur.
2. Si l'information n'y figure pas, réponds exactement : « Je ne sais pas ».
3. N'invente jamais de chiffre, de date, de nom, de source ni d'URL.
4. Pour chaque affirmation, cite la phrase du contexte qui la justifie.
5. Distingue clairement les faits des hypothèses.
→
Der simple Satz „Ich weiß es nicht“ verändert alles
Eine Anweisung hinzuzufügen, die dem Modell erlaubt, Unwissen einzugestehen, ist die Maßnahme mit dem größten Nutzen im Verhältnis zum Aufwand. Viele erfundene Aussagen entstehen allein dadurch, dass das Modell glaubt, um jeden Preis antworten zu müssen.

#Antworten auf Ihre eigenen Dokumente stützen

Die wirksamste Technik gegen KI-Halluzinationen bleibt RAG (Retrieval-Augmented Generation): Statt das Modell auf sein diffuses Wissen zurückgreifen zu lassen, stellt man ihm die relevanten Passagen aus Ihren Dokumenten bereit und fordert es auf, ausschließlich auf deren Grundlage zu antworten. Das Modell wechselt von der Rolle einer „Quelle“ in die eines „Lesers“.

  1. 01
    Ihre Dokumente indexieren
    Ihre Dateien (PDFs, Notizen, interne Dokumente) werden in Abschnitte aufgeteilt, durch ein Embedding-Modell in Vektoren umgewandelt und in einer Vektordatenbank gespeichert.
  2. 02
    Relevante Abschnitte finden
    Bei jeder Frage sucht das System nach den Textabschnitten, die der Anfrage semantisch am nächsten kommen, und ruft sie ab.
  3. 03
    In den Kontext einfügen
    Die gefundenen Passagen werden zusammen mit einer strikten Anweisung in den Prompt eingefügt: ausschließlich auf Grundlage dieser Auszüge antworten.
  4. 04
    Mit Quellenangaben generieren
    Das Modell formuliert die Antwort anhand der bereitgestellten Auszüge und gibt dabei idealerweise an, auf welche es sich stützt. Wenn die Auszüge die Antwort nicht enthalten, muss das Modell dies sagen.

Open WebUI ist mit dem Ollama-Daemon (http://localhost:11434) verbunden und bietet eine integrierte RAG-Funktion: Sie laden Dokumente hoch und verweisen im Gespräch mit `#` auf sie. Für individuelle Anforderungen bieten eine Vektordatenbank und eine selbst entwickelte Pipeline mehr Kontrolle.

i
RAG reduziert Halluzinationen, beseitigt sie aber nicht
Auch wenn ein Modell auf Quellen gestützt ist, kann es eine Passage falsch interpretieren oder über deren Inhalt hinaus extrapolieren. Die Qualität der Aufteilung und der Suche ist ebenso wichtig wie das Modell. Ein schlecht konfiguriertes RAG-System, das die falschen Auszüge liefert, erzeugt selbstsichere … und falsche Antworten.

#Systematisch überprüfen

Keine Technik macht einen LLM zu 100 % zuverlässig. Die Prüfung ist daher keine Option, sondern ein Schritt im Workflow. Sie muss dem Risiko angepasst sein.

Mit einer echten Quelle vergleichen
Jede Sachinformation, die verwendet werden soll (Zahl, Datum, Zitat), muss anhand einer Primärquelle überprüft werden. Das Modell ist ein Ausgangspunkt, niemals eine Referenz.
Den Code testen, bevor man ihm vertraut
Führen Sie den vom Modell erzeugten Code aus. Eine Funktion, die nicht existiert, löst sofort einen Fehler aus. Kopieren Sie niemals kritischen Code, ohne ihn zuvor ausgeführt zu haben.
Zwei generierte Antworten vergleichen
Stellen Sie die Frage erneut mit einem anderen Seed oder in einer neuen Sitzung. Stabile Punkte sind zuverlässiger; variierende Punkte sind verdächtig.
Ein zweites Modell verwenden
Die Antwort eines Modells von einem anderen Modell (oder einer größeren Variante) überprüfen lassen, macht offensichtliche Inkonsistenzen sichtbar.
Den Menschen weiterhin in den Prozess einbeziehen
Bei jeder Entscheidung mit Konsequenzen (Gesundheit, Recht, Geld, Sicherheit) bleibt die abschließende Prüfung einem Menschen vorbehalten. Ohne Ausnahme.

#Fälle, in denen Sie sich niemals darauf verlassen sollten

In bestimmten Bereichen häufen sich die gefährlichsten Halluzinationen. Behandeln Sie dort jede Modellausgabe als ungeprüften Entwurf, der bis zum Beweis des Gegenteils als falsch gilt.

Gesundheit und Medikamente
Dosierungen, Wechselwirkungen, Diagnosen. Eine erfundene Angabe kann gefährlich sein. Das Modell ist keine medizinische Fachkraft.
Recht und Steuern
Gesetzesartikel, Rechtsprechung, Erklärungspflichten. LLMs erfinden juristische Quellenangaben, die täuschend echt wirken.
Präzise Zahlen und Statistiken
Bevölkerungszahlen, Raten, Beträge, genaue Datumsangaben. Numerische Details sind die strukturelle Schwachstelle der Modelle.
Aktuelle Ereignisse
Alles, was nach dem Stichtag der Trainingsdaten liegt. Das Modell wird die Lücken durch Extrapolation füllen, ohne darauf hinzuweisen.
Zitate und Referenzen
Titel, Autoren, URLs, Seitenzahlen. Vor jeder Wiederverwendung systematisch und ausnahmslos überprüfen.
Personen und Fakten aus Nischenbereichen
Biografien wenig bekannter Personen, kaum bekannte Details: Das Modell kombiniert Informationsfragmente neu und erfindet den Rest.
!
Die goldene Regel
Ein lokales LLM ist ein hervorragender Assistent für das Schreiben, Brainstorming und Umformulieren. Es ist keine überprüfte Wissensbasis. Je mehr auf dem Spiel steht, desto strenger muss die menschliche Überprüfung sein.

#Weiterführende Informationen

Um Halluzinationen zu reduzieren, kommt es vor allem darauf an, die richtigen Einstellungen mit der richtigen Verankerung zu kombinieren. Diese Anleitungen ergänzen den Ansatz:

Temperatur, top-p, top-k: die Parameter
Um die hier erwähnten Sampling-Parameter im Detail zu beherrschen und den Kompromiss zwischen Kreativität und Zuverlässigkeit fein abzustimmen.
Quantisierung wählen (Q4, Q5, Q8, FP16)
Um den Einfluss der Kompression auf die faktische Genauigkeit zu verstehen und abzuwägen, wenn Zuverlässigkeit Vorrang hat.
System-Prompts beherrschen
Um sich eingehender mit Prompts für vorsichtige Antworten zu befassen und ein Verhalten, das erfundene Angaben vermeidet, als Standard festzulegen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.