Temperatur, top-p, top-k: die Parameter
Top-p (Nucleus Sampling) behält nur die wahrscheinlichsten Tokens bei, bis ihre kumulierte Wahrscheinlichkeit p erreicht, beispielsweise 0,9. Top-k behält eine feste Anzahl von Kandidaten bei, beispielsweise 40. Die Temperatur steuert den Zufallsanteil bei der Auswahl: Bei Werten nahe 0 wählt das Modell fast immer das wahrscheinlichste Token. Ollama startet mit einer Temperatur von 0,8, top-k von 40 und top-p von 0,9.
Drei Zahlen tauchen in allen Einstellungen eines lokalen Modells immer wieder auf: Temperatur, top-p und top-k. Dieser Leitfaden erklärt, was jeder dieser Parameter aus der Liste möglicher Wörter entfernt oder darin verschiebt. Er enthält ein Zahlenbeispiel, die Standardwerte von Ollama und llama.cpp, die von den Modellanbietern veröffentlichten Empfehlungen und eine Erklärung, wie Sie diese anwenden.
#Top-p, top-k, Temperatur: Definition in einer Tabelle
Bei jedem erzeugten Wort berechnet ein Modell für jeden Token seines Vokabulars eine Wahrscheinlichkeit. Die Sampling-Parameter bestimmen anschließend, welcher Token gezogen wird. Top-p und top-k verkürzen die Kandidatenliste; die Temperatur verändert den Unterschied zwischen wahrscheinlichen und unwahrscheinlichen Tokens. Keiner dieser Parameter fügt dem Modell Wissen hinzu: Sie steuern lediglich die Vielfalt und das Risiko.
| Parameter | Was es beeinflusst | Niedriger Wert | Hoher Wert | Ollama-Standardwert |
|---|---|---|---|---|
| temperature | Abstand zwischen wahrscheinlichen und unwahrscheinlichen Tokens | Deterministischere Antworten | Mehr Vielfalt, mehr Fehler | 0,8 |
| top_p | Größe der Liste, bestimmt durch die kumulierte Wahrscheinlichkeit | Kurze Liste, konservative Ausgabe | Umfangreiche Liste, höhere Vielfalt | 0,9 |
| top_k | Maximale Anzahl an Kandidaten | Wenige Kandidaten | Viele Kandidaten | 40 |
| min_p | Schwellwert bezogen auf die höchste Wahrscheinlichkeit | Leichter Filter | Starker Filter | 0,0 (deaktiviert) |
| repeat_penalty | Abwertung kürzlich verwendeter Tokens | Mehr Wiederholungen | Weniger Wiederholungen, Risiko ungewöhnlicher Ausgaben | 1,0 (deaktiviert) |
Diese Standardwerte stammen aus der Modelfile-Referenz von Ollama. Viele Modelle enthalten eigene Werte in ihrer Konfigurationsdatei, die diese Standardwerte ersetzen. Deshalb lohnt es sich, die Modellbeschreibung zu lesen, wie wir weiter unten sehen werden.
#Wie ein LLM das nächste Wort auswählt
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Das Modell erzeugt für jede Position eine Wahrscheinlichkeitsverteilung über sein gesamtes Vokabular. Immer das wahrscheinlichste Token auszuwählen – sogenanntes Greedy Decoding – führt zu eintönigen, repetitiven Texten, die manchmal in einer Schleife feststecken. Deshalb wird eine Zufallsauswahl eingeführt, die durch die Sampling-Parameter eingegrenzt wird. Ein fester Startwert (seed) macht diese Auswahl reproduzierbar: Die Ollama-Dokumentation stellt klar, dass ein bestimmter Startwert bei demselben Prompt denselben Text erzeugt.
Die Reihenfolge, in der die Filter angewendet werden, ist entscheidend. In llama.cpp, der GGUF-Inferenz-Engine, die unter anderem von LM Studio verwendet wird, lautet die Standardreihenfolge: Strafparameter, DRY, top-n sigma, top-k, typical-p, top-p, min-p, XTC und zuletzt die Temperatur. Anders gesagt: top-k und top-p arbeiten mit den ursprünglichen Wahrscheinlichkeiten, und die Temperatur dient nur dazu, aus den verbleibenden Optionen auszuwählen. Viele Tutorials geben die umgekehrte Reihenfolge an; die tatsächliche Reihenfolge kann je nach Engine unterschiedlich sein und lässt sich in llama.cpp über den Parameter --samplers einstellen.
#Ein Zahlenbeispiel: Was bei jeder Einstellung übrig bleibt
Wir betrachten sieben Kandidaten für das nächste Wort mit ihren Wahrscheinlichkeiten: 0,45 ; 0,25 ; 0,12 ; 0,08 ; 0,05 ; 0,03 ; 0,02. Diese Tabelle dient zur Illustration, nicht als Messwert eines realen Modells.
| Filter | Regel | Beibehaltene Kandidaten | Abgedeckte Wahrscheinlichkeit |
|---|---|---|---|
| Keine | Das gesamte Vokabular | 7 | 100 % |
| top_k = 3 | Die 3 besten | 3 | 82 % |
| top_p = 0,9 | Sobald die kumulierte Wahrscheinlichkeit 0,90 erreicht, wird gestoppt. | 4 (0,45 + 0,25 + 0,12 + 0,08) | 90 % |
| top_p = 0,7 | Summe von 0,70 | 2 | 70 % |
| min_p = 0,1 | Tokens behalten, deren Wahrscheinlichkeit mehr als 10 % der höchsten Token-Wahrscheinlichkeit beträgt, also einen Schwellenwert von 0,045 verwenden | 5 | 95 % |
Das Wichtigste: top-k behält unabhängig von der Situation immer dieselbe Anzahl an Kandidaten bei; top-p und min-p passen sich an. Wenn das Modell sehr sicher ist (ein Token mit 0,95), behält top-p möglicherweise nur ein oder zwei Kandidaten bei; wenn es zwischen zehn Wörtern schwankt, behält es mehr bei. Deshalb wird top-p oft gegenüber top-k bevorzugt.
#1. Temperatur: der Regler für den Zufall
Vor dem Sampling werden die Logits des Modells durch die Temperatur geteilt. Bei niedriger Temperatur wird der Abstand zwischen den Tokens größer: Der wahrscheinlichste Token dominiert die anderen. Bei hoher Temperatur verringert sich der Abstand. Bei 0 wählt das Modell immer den wahrscheinlichsten Token und erzeugt bei jedem Versuch identische Ausgaben, was die Dokumentation von llama.cpp bestätigt.
| Kandidat | Ursprüngliche Wahrscheinlichkeit | T = 0,5 | T = 1,5 |
|---|---|---|---|
| 1er | 45 % | 70 % | 34 % |
| 2e | 25 % | 22 % | 23 % |
| 3e | 12 % | 5 % | 14 % |
| 4e | 8 % | 2 % | 11 % |
| 5e à 7e | Insgesamt 10 % | 1,3 % | 17,8 % |
- 0 à 0,3
- Extraktion, Klassifizierung, inhaltsgetreue Zusammenfassung: Sie möchten bei jedem Versuch dieselbe Antwort erhalten.
- 0,4 à 0,7
- Technische Redaktion, Übersetzung, Support: Vielfalt ohne Abweichung.
- 0,8
- Standardwert von Ollama und llama.cpp: allgemeine Konversation.
- 1 und mehr
- Kreativität, Brainstorming; höheres Risiko für Fehler und Abschweifungen.
#2. Top-p: der adaptive Filter
Top-p, auch Nucleus-Sampling genannt, behält die wahrscheinlichsten Tokens bei, bis ihre kumulierte Wahrscheinlichkeit p erreicht. Bei 0,9 wird der am wenigsten wahrscheinliche Teil mit insgesamt 10 % Wahrscheinlichkeit verworfen; bei 1,0 wird nichts herausgefiltert. Die Dokumentation von Ollama weist darauf hin, dass ein höherer Wert, zum Beispiel 0,95, abwechslungsreicheren Text erzeugt und ein niedrigerer Wert, zum Beispiel 0,5, gezielteren und konservativeren Text.
- 0,5 à 0,7
- Sehr konservativ: sichere Antworten, manchmal monoton.
- 0,9
- Ollamas Standardwert: beschneidet den Rand der Verteilung, ohne die Vielfalt zu unterdrücken.
- 0,95
- Standardwert von llama-server und in mehreren Modellkarten empfohlener Wert.
- 1,0
- Filter deaktiviert: Die Temperatur wirkt allein.
#3. Top-k: fester Grenzwert
Top-k berücksichtigt nur die k wahrscheinlichsten Tokens. Die Dokumentation von Ollama beschreibt diesen Parameter als Mittel, um die Wahrscheinlichkeit zu verringern, Unsinn zu erzeugen: Ein höherer Wert (100) führt zu vielfältigeren Antworten, ein niedrigerer (10) zu konservativeren. Der Standardwert ist 40, wie in llama.cpp, wo 0 den Parameter deaktiviert.
| Filter | Vorteil | Grenze | Wann einsetzen |
|---|---|---|---|
| top_k | Einfach, begrenzt den Rechenaufwand | Ignoriert die Form der Verteilung: zu viele Kandidaten, wenn das Modell sicher ist, zu wenige, wenn es unsicher ist | Weit gefasste Begrenzung (20 bis 100) |
| top_p | Passt sich an die Konfidenz des Modells an | Kann bei einer flachen Verteilung einen langen Verteilungsschwanz durchlassen | Hauptparameter für Diversität |
| min_p | Schwellenwert relativ zur höchsten Wahrscheinlichkeit, auch bei hoher Temperatur stabil | Weniger bekannt, in Ollama standardmäßig nicht aktiviert | Alternative zu top_p, oft mit höherer Temperatur |
Zur Suchanfrage „top p vs top k“: Verwenden Sie top-p als Haupteinstellung, behalten Sie top-k als zusätzliche Begrenzung bei und ändern Sie nicht beide im selben Versuch, sonst wissen Sie nicht, welcher Parameter den Unterschied verursacht hat.
#Standardwerte und Empfehlungen der Hersteller
Die Standardwerte einer Inferenz-Engine sind ein allgemeiner Kompromiss. Modellanbieter veröffentlichen häufig Werte, die auf ihre Modelle abgestimmt sind und von den Standardwerten abweichen können. Hier sind die Empfehlungen aus der Modellkarte von Qwen3.5 für die zugehörigen Modelle, zum Vergleich mit den Standardwerten von Ollama (Temperatur 0,8, top-p 0,9, top-k 40).
| Modus | Temperatur | top_p | top_k | presence_penalty |
|---|---|---|---|---|
| Logisches Schlussfolgern, allgemeine Aufgaben | 1,0 | 0,95 | 20 | 1,5 |
| Schlussfolgerndes Denken, präziser Code | 0,6 | 0,95 | 20 | 0,0 |
| Ohne Reasoning, allgemeine Aufgaben | 0,7 | 0,8 | 20 | 1,5 |
Diese Werte gelten für diese Modellfamilie, nicht für alle Modelle. Die Modellbeschreibungen anderer Herausgeber nennen andere Werte: Suchen Sie den Abschnitt zu den empfohlenen Sampling-Parametern in der Modellbeschreibung auf Hugging Face oder auf der Modellseite in der Ollama-Bibliothek. Die Modellbeschreibung von Qwen weist außerdem darauf hin, dass die Unterstützung dieser Parameter je nach Inferenz-Engine variiert.
#Strafparameter: Wiederholung, Häufigkeit, Präsenz
Lokale Modelle, besonders kleine oder stark quantisierte, wiederholen manchmal dieselben Sätze in einer Schleife. Strafparameter schaffen Abhilfe, aber ihre Standardwerte sind oft wenig bekannt. In Ollama hat repeat_penalty standardmäßig den Wert 1,0 und ist damit deaktiviert; die Dokumentation nennt 1,5 als Beispiel für einen Wert, der Wiederholungen stärker bestraft. Der oft genannte Wert 1,1 ist eine bewusst zu wählende Einstellung, kein Standardwert.
- repeat_penalty
- Bestraft kürzlich verwendete Tokens; repeat_last_n (standardmäßig 64) legt das berücksichtigte Fenster fest.
- frequency_penalty
- Eine zur Anzahl der Vorkommen proportionale Strafgewichtung für lange Textgenerierungen.
- presence_penalty
- Abzug, sobald ein Token bereits aufgetreten ist, um einen abwechslungsreicheren Wortschatz zu fördern; Qwen empfiehlt 1,5 in mehreren seiner Modi, wobei bei einem zu hohen Wert das Risiko besteht, dass sich Sprachen vermischen.
#Diese Einstellungen in Ollama anwenden
Es gibt zwei Methoden: ein Modelfile, das Werte für ein benanntes Modell festlegt, oder das Feld options einer API-Anfrage, das dieselben Parameter wie das Modelfile akzeptiert. Das Modelfile eignet sich für den täglichen Gebrauch, die API für ein Programm.
Weitere Informationen zu Modelfiles (Systemprompt, Kontext, Vorlage) finden Sie im Leitfaden zur Anpassung. In LM Studio und Jan lassen sich dieselben Parameter im Konfigurationsbereich des Modells einstellen.
#Reasoning-Modelle: nicht alles über die Temperatur regeln
Reasoning-Modelle erzeugen zunächst eine Denkspur, bevor sie antworten. In Ollama stellen diese Modelle ein separates Feld für den Denkprozess bereit, und die verfügbaren Befehle variieren je nach Modell: Die Dokumentation empfiehlt, die show-API abzufragen, um die zulässigen Werte und den Standardwert zu ermitteln. Bei gpt-oss beispielsweise gibt es die Stufen low, medium und high, wobei medium der Standardwert ist.
Um unnötige Abbrüche bei einer einfachen Frage zu vermeiden, agieren Sie zuerst auf dem Niveau der Reflexion, wenn dieses vorhanden ist, anstatt auf der Temperatur. Die Temperatur muss den Modellbeschreibung entsprechen: zu kalte Überlegungen können sich verstopfen, zu heiße können sich verstreuen.
#Voreinstellungen als Ausgangspunkt je nach Anwendungsfall
| Nutzung | Temperatur | top_p | Andere Einstellungen |
|---|---|---|---|
| Extraktion, Klassifizierung, JSON | 0 à 0,2 | 0,9 | Strenge Formatanforderung im Prompt |
| Inhaltstreue Zusammenfassung | 0,2 à 0,3 | 0,9 | repeat_penalty leicht über 1 |
| Allgemeine Konversation | 0,7 à 0,8 | 0,9 | Standardeinstellungen der Engine |
| Schreiben, Ideen | 0,8 à 1,0 | 0,95 | Moderate presence_penalty |
| Fiktion, Kreativität | 1,0 | 0,95 | Abschweifungen kontrollieren |
Diese Presets sind Ausgangspunkte, keine Messwerte. Ändern Sie jeweils nur einen Parameter, führen Sie denselben Prompt dreimal aus und vergleichen Sie: Wenn drei Versuche dieselbe Antwort liefern, obwohl Sie Abwechslung erwarten, ist die Temperatur zu niedrig oder der Seed festgelegt.
#Symptome und Einstellungen zum Ausprobieren
- Das Modell wiederholt denselben Satz
- Setzen Sie repeat_penalty auf etwa 1,1 oder aktivieren Sie presence_penalty, oder verkürzen Sie die Generierung mit num_predict.
- Flache und generische Antworten
- Erhöhen Sie die Temperatur um einen Schritt (von 0,7 auf 0,9) oder lockern Sie die Einschränkung durch top_p.
- Das Modell erfindet Fakten
- Senken Sie die Temperatur, beachten Sie aber, dass das nicht ausreicht: siehe den Leitfaden zu Halluzinationen.
- Ungültiges JSON
- Niedrige Temperatur und explizit angefordertes Format; verwenden Sie den strukturierten Ausgabemodus von Ollama, wenn er verfügbar ist.
- Sprachmischung oder seltsame Wörter
- Senken Sie presence_penalty oder repeat_penalty oder erhöhen Sie leicht die Quantisierung des Modells.
Was ist top-p in einem LLM?+
Was ist der Unterschied zwischen top-p und top-k?+
Sollte man Temperatur und top-p gleichzeitig einstellen?+
Welche Temperatur für Code?+
Welche Standardwerte gibt es in Ollama?+
Was ist min-p und sollte man es verwenden?+
- Ollama Modelfile: Ein Modell anpassen
- Grundlagen des Promptings
- System-Prompts beherrschen
- Das Kontextfenster verstehen
- Halluzinationen eines lokalen LLM begrenzen
- Quelle: Ollamas Modelfile-Referenz
- Quelle: Datenblatt Qwen3.5-9B
- Quelle: llama.cpp, Optionen von llama-server
- Quelle: Ollama, Modelle mit Denkfunktion
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.