Mittelstufe 11 Min.Konfiguration

Temperatur, top-p, top-k: die Parameter

Direkte Antwort

Top-p (Nucleus Sampling) behält nur die wahrscheinlichsten Tokens bei, bis ihre kumulierte Wahrscheinlichkeit p erreicht, beispielsweise 0,9. Top-k behält eine feste Anzahl von Kandidaten bei, beispielsweise 40. Die Temperatur steuert den Zufallsanteil bei der Auswahl: Bei Werten nahe 0 wählt das Modell fast immer das wahrscheinlichste Token. Ollama startet mit einer Temperatur von 0,8, top-k von 40 und top-p von 0,9.

Drei Zahlen tauchen in allen Einstellungen eines lokalen Modells immer wieder auf: Temperatur, top-p und top-k. Dieser Leitfaden erklärt, was jeder dieser Parameter aus der Liste möglicher Wörter entfernt oder darin verschiebt. Er enthält ein Zahlenbeispiel, die Standardwerte von Ollama und llama.cpp, die von den Modellanbietern veröffentlichten Empfehlungen und eine Erklärung, wie Sie diese anwenden.

Von Mohamed Meguedmi·Aktualisierung 2026-09-29·Unter Windows, macOS und Linux getestet

#Top-p, top-k, Temperatur: Definition in einer Tabelle

Bei jedem erzeugten Wort berechnet ein Modell für jeden Token seines Vokabulars eine Wahrscheinlichkeit. Die Sampling-Parameter bestimmen anschließend, welcher Token gezogen wird. Top-p und top-k verkürzen die Kandidatenliste; die Temperatur verändert den Unterschied zwischen wahrscheinlichen und unwahrscheinlichen Tokens. Keiner dieser Parameter fügt dem Modell Wissen hinzu: Sie steuern lediglich die Vielfalt und das Risiko.

Was jeder Parameter tut
ParameterWas es beeinflusstNiedriger WertHoher WertOllama-Standardwert
temperatureAbstand zwischen wahrscheinlichen und unwahrscheinlichen TokensDeterministischere AntwortenMehr Vielfalt, mehr Fehler0,8
top_pGröße der Liste, bestimmt durch die kumulierte WahrscheinlichkeitKurze Liste, konservative AusgabeUmfangreiche Liste, höhere Vielfalt0,9
top_kMaximale Anzahl an KandidatenWenige KandidatenViele Kandidaten40
min_pSchwellwert bezogen auf die höchste WahrscheinlichkeitLeichter FilterStarker Filter0,0 (deaktiviert)
repeat_penaltyAbwertung kürzlich verwendeter TokensMehr WiederholungenWeniger Wiederholungen, Risiko ungewöhnlicher Ausgaben1,0 (deaktiviert)

Diese Standardwerte stammen aus der Modelfile-Referenz von Ollama. Viele Modelle enthalten eigene Werte in ihrer Konfigurationsdatei, die diese Standardwerte ersetzen. Deshalb lohnt es sich, die Modellbeschreibung zu lesen, wie wir weiter unten sehen werden.

#Wie ein LLM das nächste Wort auswählt

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Das Modell erzeugt für jede Position eine Wahrscheinlichkeitsverteilung über sein gesamtes Vokabular. Immer das wahrscheinlichste Token auszuwählen – sogenanntes Greedy Decoding – führt zu eintönigen, repetitiven Texten, die manchmal in einer Schleife feststecken. Deshalb wird eine Zufallsauswahl eingeführt, die durch die Sampling-Parameter eingegrenzt wird. Ein fester Startwert (seed) macht diese Auswahl reproduzierbar: Die Ollama-Dokumentation stellt klar, dass ein bestimmter Startwert bei demselben Prompt denselben Text erzeugt.

Die Reihenfolge, in der die Filter angewendet werden, ist entscheidend. In llama.cpp, der GGUF-Inferenz-Engine, die unter anderem von LM Studio verwendet wird, lautet die Standardreihenfolge: Strafparameter, DRY, top-n sigma, top-k, typical-p, top-p, min-p, XTC und zuletzt die Temperatur. Anders gesagt: top-k und top-p arbeiten mit den ursprünglichen Wahrscheinlichkeiten, und die Temperatur dient nur dazu, aus den verbleibenden Optionen auszuwählen. Viele Tutorials geben die umgekehrte Reihenfolge an; die tatsächliche Reihenfolge kann je nach Engine unterschiedlich sein und lässt sich in llama.cpp über den Parameter --samplers einstellen.

i
Was sich für Sie ändert
Da die Temperatur in llama.cpp nach den Filtern angewendet wird, führt ein Anheben der Temperatur nicht dazu, dass sinnlose Tokens eingefügt werden, die bereits durch top-k oder top-p ausgeschlossen wurden: Sie verteilt die Chancen unter den verbleibenden Kandidaten.

#Ein Zahlenbeispiel: Was bei jeder Einstellung übrig bleibt

Wir betrachten sieben Kandidaten für das nächste Wort mit ihren Wahrscheinlichkeiten: 0,45 ; 0,25 ; 0,12 ; 0,08 ; 0,05 ; 0,03 ; 0,02. Diese Tabelle dient zur Illustration, nicht als Messwert eines realen Modells.

Welche Kandidaten je nach Filter übrig bleiben
FilterRegelBeibehaltene KandidatenAbgedeckte Wahrscheinlichkeit
KeineDas gesamte Vokabular7100 %
top_k = 3Die 3 besten382 %
top_p = 0,9Sobald die kumulierte Wahrscheinlichkeit 0,90 erreicht, wird gestoppt.4 (0,45 + 0,25 + 0,12 + 0,08)90 %
top_p = 0,7Summe von 0,70270 %
min_p = 0,1Tokens behalten, deren Wahrscheinlichkeit mehr als 10 % der höchsten Token-Wahrscheinlichkeit beträgt, also einen Schwellenwert von 0,045 verwenden595 %

Das Wichtigste: top-k behält unabhängig von der Situation immer dieselbe Anzahl an Kandidaten bei; top-p und min-p passen sich an. Wenn das Modell sehr sicher ist (ein Token mit 0,95), behält top-p möglicherweise nur ein oder zwei Kandidaten bei; wenn es zwischen zehn Wörtern schwankt, behält es mehr bei. Deshalb wird top-p oft gegenüber top-k bevorzugt.

#1. Temperatur: der Regler für den Zufall

Vor dem Sampling werden die Logits des Modells durch die Temperatur geteilt. Bei niedriger Temperatur wird der Abstand zwischen den Tokens größer: Der wahrscheinlichste Token dominiert die anderen. Bei hoher Temperatur verringert sich der Abstand. Bei 0 wählt das Modell immer den wahrscheinlichsten Token und erzeugt bei jedem Versuch identische Ausgaben, was die Dokumentation von llama.cpp bestätigt.

Auswirkung der Temperatur auf das vorherige Beispiel (Berechnung zur Veranschaulichung)
KandidatUrsprüngliche WahrscheinlichkeitT = 0,5T = 1,5
1er45 %70 %34 %
2e25 %22 %23 %
3e12 %5 %14 %
4e8 %2 %11 %
5e à 7eInsgesamt 10 %1,3 %17,8 %
0 à 0,3
Extraktion, Klassifizierung, inhaltsgetreue Zusammenfassung: Sie möchten bei jedem Versuch dieselbe Antwort erhalten.
0,4 à 0,7
Technische Redaktion, Übersetzung, Support: Vielfalt ohne Abweichung.
0,8
Standardwert von Ollama und llama.cpp: allgemeine Konversation.
1 und mehr
Kreativität, Brainstorming; höheres Risiko für Fehler und Abschweifungen.
!
Temperatur 0: Nicht immer die beste Wahl für Code
Für Ausgaben, die geparst werden müssen (JSON, Klassifikation), ist eine niedrige Temperatur sinnvoll. Die Anbieter von Reasoning-Modellen empfehlen jedoch häufig höhere Werte: Die Modellkarte von Qwen3.5 nennt 0,6 für Code im Reasoning-Modus und 1,0 für allgemeine Aufgaben. Lesen Sie die Modellkarte, bevor Sie die Temperatur auf 0 festlegen.

#2. Top-p: der adaptive Filter

Top-p, auch Nucleus-Sampling genannt, behält die wahrscheinlichsten Tokens bei, bis ihre kumulierte Wahrscheinlichkeit p erreicht. Bei 0,9 wird der am wenigsten wahrscheinliche Teil mit insgesamt 10 % Wahrscheinlichkeit verworfen; bei 1,0 wird nichts herausgefiltert. Die Dokumentation von Ollama weist darauf hin, dass ein höherer Wert, zum Beispiel 0,95, abwechslungsreicheren Text erzeugt und ein niedrigerer Wert, zum Beispiel 0,5, gezielteren und konservativeren Text.

0,5 à 0,7
Sehr konservativ: sichere Antworten, manchmal monoton.
0,9
Ollamas Standardwert: beschneidet den Rand der Verteilung, ohne die Vielfalt zu unterdrücken.
0,95
Standardwert von llama-server und in mehreren Modellkarten empfohlener Wert.
1,0
Filter deaktiviert: Die Temperatur wirkt allein.

#3. Top-k: fester Grenzwert

Top-k berücksichtigt nur die k wahrscheinlichsten Tokens. Die Dokumentation von Ollama beschreibt diesen Parameter als Mittel, um die Wahrscheinlichkeit zu verringern, Unsinn zu erzeugen: Ein höherer Wert (100) führt zu vielfältigeren Antworten, ein niedrigerer (10) zu konservativeren. Der Standardwert ist 40, wie in llama.cpp, wo 0 den Parameter deaktiviert.

Top-k, top-p oder min-p: Welchen Filter verwenden?
FilterVorteilGrenzeWann einsetzen
top_kEinfach, begrenzt den RechenaufwandIgnoriert die Form der Verteilung: zu viele Kandidaten, wenn das Modell sicher ist, zu wenige, wenn es unsicher istWeit gefasste Begrenzung (20 bis 100)
top_pPasst sich an die Konfidenz des Modells anKann bei einer flachen Verteilung einen langen Verteilungsschwanz durchlassenHauptparameter für Diversität
min_pSchwellenwert relativ zur höchsten Wahrscheinlichkeit, auch bei hoher Temperatur stabilWeniger bekannt, in Ollama standardmäßig nicht aktiviertAlternative zu top_p, oft mit höherer Temperatur

Zur Suchanfrage „top p vs top k“: Verwenden Sie top-p als Haupteinstellung, behalten Sie top-k als zusätzliche Begrenzung bei und ändern Sie nicht beide im selben Versuch, sonst wissen Sie nicht, welcher Parameter den Unterschied verursacht hat.

#Standardwerte und Empfehlungen der Hersteller

Die Standardwerte einer Inferenz-Engine sind ein allgemeiner Kompromiss. Modellanbieter veröffentlichen häufig Werte, die auf ihre Modelle abgestimmt sind und von den Standardwerten abweichen können. Hier sind die Empfehlungen aus der Modellkarte von Qwen3.5 für die zugehörigen Modelle, zum Vergleich mit den Standardwerten von Ollama (Temperatur 0,8, top-p 0,9, top-k 40).

Empfohlene Einstellungen in der Model Card von Qwen3.5-9B auf Hugging Face
ModusTemperaturtop_ptop_kpresence_penalty
Logisches Schlussfolgern, allgemeine Aufgaben1,00,95201,5
Schlussfolgerndes Denken, präziser Code0,60,95200,0
Ohne Reasoning, allgemeine Aufgaben0,70,8201,5

Diese Werte gelten für diese Modellfamilie, nicht für alle Modelle. Die Modellbeschreibungen anderer Herausgeber nennen andere Werte: Suchen Sie den Abschnitt zu den empfohlenen Sampling-Parametern in der Modellbeschreibung auf Hugging Face oder auf der Modellseite in der Ollama-Bibliothek. Die Modellbeschreibung von Qwen weist außerdem darauf hin, dass die Unterstützung dieser Parameter je nach Inferenz-Engine variiert.

#Strafparameter: Wiederholung, Häufigkeit, Präsenz

Lokale Modelle, besonders kleine oder stark quantisierte, wiederholen manchmal dieselben Sätze in einer Schleife. Strafparameter schaffen Abhilfe, aber ihre Standardwerte sind oft wenig bekannt. In Ollama hat repeat_penalty standardmäßig den Wert 1,0 und ist damit deaktiviert; die Dokumentation nennt 1,5 als Beispiel für einen Wert, der Wiederholungen stärker bestraft. Der oft genannte Wert 1,1 ist eine bewusst zu wählende Einstellung, kein Standardwert.

repeat_penalty
Bestraft kürzlich verwendete Tokens; repeat_last_n (standardmäßig 64) legt das berücksichtigte Fenster fest.
frequency_penalty
Eine zur Anzahl der Vorkommen proportionale Strafgewichtung für lange Textgenerierungen.
presence_penalty
Abzug, sobald ein Token bereits aufgetreten ist, um einen abwechslungsreicheren Wortschatz zu fördern; Qwen empfiehlt 1,5 in mehreren seiner Modi, wobei bei einem zu hohen Wert das Risiko besteht, dass sich Sprachen vermischen.
→
Die Penaltys in kleinen Schritten erhöhen
Eine hohe Penalty drängt das Modell zu seltenen oder unerwarteten Wörtern. Erhöhen Sie repeat_penalty in Schritten von 0,05 bis 0,1 und hören Sie auf, sobald die Wiederholungsschleifen verschwinden.

#Diese Einstellungen in Ollama anwenden

Es gibt zwei Methoden: ein Modelfile, das Werte für ein benanntes Modell festlegt, oder das Feld options einer API-Anfrage, das dieselben Parameter wie das Modelfile akzeptiert. Das Modelfile eignet sich für den täglichen Gebrauch, die API für ein Programm.

Modelfile: ein benutzerdefiniertes Modell
FROM llama3.2
PARAMETER temperature 0.3
PARAMETER top_p 0.9
PARAMETER top_k 40
Dieses Modell erstellen und anschließend starten
ollama create llama-precis -f ./Modelfile
ollama run llama-precis
Gleiche Einstellung bei einer API-Anfrage.
curl http://localhost:11434/api/generate -d '{"model":"llama3.2","prompt":"Résume en une phrase : ...","stream":false,"options":{"temperature":0.3,"top_p":0.9}}'

Weitere Informationen zu Modelfiles (Systemprompt, Kontext, Vorlage) finden Sie im Leitfaden zur Anpassung. In LM Studio und Jan lassen sich dieselben Parameter im Konfigurationsbereich des Modells einstellen.

#Reasoning-Modelle: nicht alles über die Temperatur regeln

Reasoning-Modelle erzeugen zunächst eine Denkspur, bevor sie antworten. In Ollama stellen diese Modelle ein separates Feld für den Denkprozess bereit, und die verfügbaren Befehle variieren je nach Modell: Die Dokumentation empfiehlt, die show-API abzufragen, um die zulässigen Werte und den Standardwert zu ermitteln. Bei gpt-oss beispielsweise gibt es die Stufen low, medium und high, wobei medium der Standardwert ist.

Um unnötige Abbrüche bei einer einfachen Frage zu vermeiden, agieren Sie zuerst auf dem Niveau der Reflexion, wenn dieses vorhanden ist, anstatt auf der Temperatur. Die Temperatur muss den Modellbeschreibung entsprechen: zu kalte Überlegungen können sich verstopfen, zu heiße können sich verstreuen.

#Voreinstellungen als Ausgangspunkt je nach Anwendungsfall

Ausgangswerte zum Anpassen, ausgenommen Modelle mit spezifischen Empfehlungen
NutzungTemperaturtop_pAndere Einstellungen
Extraktion, Klassifizierung, JSON0 à 0,20,9Strenge Formatanforderung im Prompt
Inhaltstreue Zusammenfassung0,2 à 0,30,9repeat_penalty leicht über 1
Allgemeine Konversation0,7 à 0,80,9Standardeinstellungen der Engine
Schreiben, Ideen0,8 à 1,00,95Moderate presence_penalty
Fiktion, Kreativität1,00,95Abschweifungen kontrollieren

Diese Presets sind Ausgangspunkte, keine Messwerte. Ändern Sie jeweils nur einen Parameter, führen Sie denselben Prompt dreimal aus und vergleichen Sie: Wenn drei Versuche dieselbe Antwort liefern, obwohl Sie Abwechslung erwarten, ist die Temperatur zu niedrig oder der Seed festgelegt.

#Symptome und Einstellungen zum Ausprobieren

Das Modell wiederholt denselben Satz
Setzen Sie repeat_penalty auf etwa 1,1 oder aktivieren Sie presence_penalty, oder verkürzen Sie die Generierung mit num_predict.
Flache und generische Antworten
Erhöhen Sie die Temperatur um einen Schritt (von 0,7 auf 0,9) oder lockern Sie die Einschränkung durch top_p.
Das Modell erfindet Fakten
Senken Sie die Temperatur, beachten Sie aber, dass das nicht ausreicht: siehe den Leitfaden zu Halluzinationen.
Ungültiges JSON
Niedrige Temperatur und explizit angefordertes Format; verwenden Sie den strukturierten Ausgabemodus von Ollama, wenn er verfügbar ist.
Sprachmischung oder seltsame Wörter
Senken Sie presence_penalty oder repeat_penalty oder erhöhen Sie leicht die Quantisierung des Modells.
Häufige Fragen zu top-p, top-k und der Temperatur
Was ist top-p in einem LLM?+
Top-p ist ein Filter, der nur die wahrscheinlichsten Tokens behält, deren Wahrscheinlichkeitssumme den Schwellenwert p erreicht, beispielsweise 0,9. Der Rest wird vor dem Ziehen ausgeschlossen. Im Gegensatz zu top-k variiert die Anzahl der Kandidaten: gering, wenn das Modell sicher ist, größer, wenn es zögert.
Was ist der Unterschied zwischen top-p und top-k?+
top-k behält immer eine feste Anzahl von Kandidaten bei, beispielsweise 40, unabhängig von der Situation. top-p behält je nach kumulierter Wahrscheinlichkeit eine variable Anzahl von Kandidaten bei. top-p passt sich daher besser an die Sicherheit des Modells an; top-k dient als einfache Absicherung gegen sehr unwahrscheinliche Tokens.
Sollte man Temperatur und top-p gleichzeitig einstellen?+
Ändern Sie am besten jeweils nur einen Parameter, um seine Wirkung zu verstehen. Lassen Sie in der Praxis top-p und top-k auf ihren Standardwerten oder den Werten aus der Modellbeschreibung und passen Sie die Temperatur an. Wenn Sie mehrere Einstellungen gleichzeitig ändern, wissen Sie nicht, welche davon den Unterschied verursacht hat.
Welche Temperatur für Code?+
Bei einem Modell ohne Reasoning liefert ein niedriger Wert (0 bis 0,2) reproduzierbare Ausgaben. Bei einem Reasoning-Modell richten Sie sich nach der Modellkarte des Anbieters: Die Modellkarte von Qwen3.5 empfiehlt 0,6 für präzisen Code im Reasoning-Modus. Testen Sie dies anhand Ihrer eigenen Fälle und prüfen Sie, ob der Code kompiliert oder Ihre Tests besteht.
Welche Standardwerte gibt es in Ollama?+
Die Modelfile-Dokumentation nennt eine Temperatur von 0,8, einen top-k-Wert von 40, einen top-p-Wert von 0,9, einen min-p-Wert von 0,0 (deaktiviert) und eine Wiederholungsstrafe von 1,0 (deaktiviert). Ein Modell kann eigene Werte mitbringen und diese Vorgaben überschreiben; mit ollama show --modelfile lassen sich die Werte anzeigen.
Was ist min-p und sollte man es verwenden?+
Min-p entfernt Tokens, deren Wahrscheinlichkeit unter einem Bruchteil der Wahrscheinlichkeit des besten Kandidaten liegt: Bei einem Wert von 0,05 und einer Wahrscheinlichkeit von 0,9 für das beste Token beträgt der Schwellenwert 0,045. Es ist eine Alternative zu top-p und in Ollama standardmäßig deaktiviert. Verwenden Sie min-p nur, wenn die Modellbeschreibung es empfiehlt.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.