Einsteiger 11 Min.Konfiguration

Verstehen der Fenster von Kontext

Direkte Antwort

Das Kontextfenster ist die maximale Anzahl an Tokens, die das Modell auf einmal verarbeitet: Systemanweisung, Verlauf, beigefügte Dokumente und die gerade generierte Antwort, alles zusammengerechnet. Es benötigt Speicher, weil für jedes Token ein Eintrag im KV-Cache vorgehalten wird. Bei Ollama beträgt der Standardwert auf einer Grafikkarte mit weniger als 24 GiB VRAM 4.096 Tokens: Oft begrenzt das Kontextfenster, nicht das Modell, wie viel Sie das Modell lesen lassen können.

Ist das Kontextfenster zu klein, vergisst das Modell den Anfang eines Gesprächs oder ein Dokument wird gekürzt. Ist es zu groß, wird der VRAM vollständig belegt und alles wird langsamer. Dieser Leitfaden erklärt, was das Fenster enthält, berechnet seinen Speicherverbrauch anhand der Architektur eines realen Modells und zeigt, wie Sie es ohne böse Überraschungen einstellen können.

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet

#Was das Kontextfenster enthält

Laut der Dokumentation von Ollama ist die Kontextlänge die maximale Anzahl an Tokens, auf die das Modell im Speicher zugreifen kann. Alles zählt zu diesem einen Budget: die Systemnachricht, der Gesprächsverlauf, die Dateien oder Dokumentpassagen, die Sie einfügen, Ihre letzte Frage und die Antwort, die das Modell gerade schreibt. Bei einem Reasoning-Modell zählen auch die Denktokens mit. Wenn die Gesamtzahl das Kontextfenster überschreitet, muss etwas wegfallen: Die Tools kürzen in der Regel den Anfang oder lehnen die Anfrage ab. Das Modell hat kein Gedächtnis außerhalb dieses Fensters, es sei denn, ein externes System (Zusammenfassung, RAG) führt ihm erneut Informationen zu.

i
Kontextfenster und Gedächtnis sind nicht dasselbe
Ein Assistent, der sich an ein Gespräch von gestern „erinnert“, tut dies nicht dank des Kontextfensters: Die Anwendung liest einen Verlauf oder eine Datenbank erneut ein und kopiert den Inhalt in den Prompt. Das Kontextfenster begrenzt, was zu einem bestimmten Zeitpunkt darin Platz finden kann.

#Das Token: die Einheit, die das Fenster füllt

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Ein Token ist kein Wort: Es ist ein Textfragment, das vom Tokenizer des Modells definiert wird, oft eine Silbe oder ein häufiges Wort. Ein seltenes oder langes Wort benötigt mehrere Tokens. Französisch verbraucht für gleichwertige Inhalte im Allgemeinen mehr Tokens als Englisch, weil die meisten Tokenizer hauptsächlich auf englischen Texten trainiert wurden. Das genaue Verhältnis variiert von Modell zu Modell: Verlassen Sie sich nicht auf eine Faustregel, sondern messen Sie nach. Die API von Ollama gibt bei jeder Anfrage prompt_eval_count zurück, die Anzahl der Tokens im Prompt.

Die tatsächlichen Token eines Prompts zählen
curl http://localhost:11434/api/generate -d '{"model":"qwen3:8b","prompt":"Bonjour le monde","stream":false}'
# lisez prompt_eval_count et eval_count dans la réponse JSON
Faustregel
Eine A4-Seite mit dichtem französischem Text entspricht je nach Tokenizer ungefähr tausend Tokens: Überprüfen Sie dies mit prompt_eval_count anhand Ihres eigenen Dokuments.
Ein Buch
Mehrere Hunderttausend Tokens: Ohne Aufteilung passt das nicht in ein Kontextfenster von 32.000 oder 64.000 Tokens.
Eine Antwort
Ein Reasoning-Modell kann vor der sichtbaren Antwort Tausende von Denktokens erzeugen, die Platz im Kontextfenster beanspruchen.

#Welche Kontextfenstergröße wählen?

Ollama legt seinen Standardwert je nach Grafikspeicher fest: etwa 4 000 Tokens (4k) bei weniger als 24 GiB VRAM, 32k zwischen 24 und 48 GiB und 256k ab 48 GiB. Dieselbe Seite empfiehlt mindestens 64 000 Tokens für Aufgaben, die einen großen Kontext erfordern, wie Websuche, Agenten und Coding-Tools. Neuere Modelle weisen deutlich höhere Maximalwerte aus: Der Katalog von QuelLLM gibt beispielsweise etwa 256 000 Tokens für Kimi K2.5 und etwa 1 Million für Kimi K3, DeepSeek V4 Flash und GLM 5.2 an. Aber ein angegebener Maximalwert ist kein auf Ihrem Computer nutzbarer Kontext: Der Speicher und manchmal auch die Qualität stehen dem entgegen.

Welches Fenster für welchen Einsatzzweck
NutzungKontextfenster als RichtwertHinweis
Kurze Konversation, Fragen und Antworten4.096 bis 8.192 TokensReicht aus, wenn Sie keine Dokumente einfügen
Zusammenfassung oder Analyse eines Artikels16.000 bis 32.000 TokensPrüfen Sie die Anzahl der Tokens im Text
Code-Assistent für ein Repository64.000 Tokens oder mehrEmpfohlen von Ollama für Code-Tools
Agent mit Werkzeugen und Webrecherche64.000 Tokens oder mehrJeder Tool-Aufruf speist erneut Text ein
Sehr großes KorpusRichten Sie nicht auf das FensterNutzen Sie RAG, statt alles zu senden

Bei der Dimensionierung treten häufig zwei Fallstricke auf. Erstens muss auch die Antwort in das Kontextfenster passen: Wenn Sie 31.000 der 32.000 Tokens mit einem Dokument belegen, bleibt kaum Platz für die Antwort, und ein Reasoning-Modell stoppt mitten im Denkprozess. Zweitens wächst in einem Gespräch der Verlauf mit jeder Runde: Ein Kontextfenster, das für die erste Nachricht ausreicht, kann bei der zwanzigsten bereits voll sein. Planen Sie daher für den ungünstigsten Fall Ihrer Nutzung, nicht für den Durchschnitt, und halten Sie etwa ein Fünftel des Kontextfensters als Reserve frei.

#Wie viel Speicher kostet der Kontext?

Jedes Token im Kontextfenster hinterlässt in jeder Schicht des Modells einen Schlüssel und einen Wert, die im KV-Cache gespeichert werden. Der Speicherbedarf pro Token lässt sich aus vier Architekturgrößen berechnen: der Anzahl der Schichten, der Anzahl der Schlüssel-Wert-Heads, der Dimension eines Heads und der Speichergröße einer Zahl (2 Bytes bei FP16). Die Formel lautet: 2 (Schlüssel und Wert) × Schichten × KV-Heads × Head-Dimension × 2 Bytes. Achtung: Entscheidend sind die Schlüssel-Wert-Heads, nicht die Attention-Heads, da sich bei neueren Modellen mehrere Attention-Heads dieselben Schlüssel-Wert-Heads teilen (grouped-query attention). Eine Berechnung mit der Anzahl der Attention-Heads überschätzt den Cache beim untenstehenden Modell um den Faktor vier.

Nehmen wir Qwen3-8B: Die offizielle Modellbeschreibung nennt 36 Schichten und 8 Key-Value-Heads (gegenüber 32 Query-Heads), und die öffentlich verfügbare Konfiguration legt die Dimension eines Heads auf 128 fest. Der Speicherbedarf beträgt 2 × 36 × 8 × 128 × 2 = 147.456 Byte pro Token, also 144 KiB.

KV-Cache von Qwen3-8B in FP16 (nach seiner Konfiguration berechnet)
KontextKV-Cache (FP16)KV-Cache (q8_0, etwa die Hälfte)
4 096 Tokens0,56 GiB0,28 GiB
8 192 Tokens1,13 GiB0,56 GiB
16 384 Tokens2,25 GiB1,13 GiB
32 768 Tokens4,50 GiB2,25 GiB
131.072 Tokens (mit YaRN, laut Modellkarte)18,00 GiB9,00 GiB
!
Die Falle bei einer 8-GB-Karte
Qwen3-8B in Q4 benötigt für seine Gewichte etwa 5 GB. Bei 32.768 Kontexttokens kommen durch den KV-Cache 4,5 GiB hinzu, sodass der Speicherbedarf bereits vor den Rechenpuffern etwa 9,5 GB erreicht. Auf einer Karte mit 8 GB wird das Modell dann teilweise auf die CPU ausgelagert, und die Generierung verlangsamt sich stark, ohne dass eine klare Fehlermeldung erscheint. Überprüfen Sie dies mit ollama ps.

Zwei Maßnahmen verkleinern den Cache. Die erste ist die Quantisierung des Caches: Laut Ollamas FAQ benötigt der Typ q8_0 etwa halb so viel Speicher wie FP16 bei sehr geringem Qualitätsverlust, q4_0 etwa ein Viertel bei einem deutlicheren Qualitätsverlust mit großen Kontexten. Beide setzen voraus, dass Flash Attention aktiviert ist. Die zweite Maßnahme besteht darin, das Kontextfenster auf die benötigte Größe zu verkleinern. Unser Leitfaden zum KV-Cache erläutert die Einstellungen im Detail.

#Die Kontextlänge einstellen

#Unter Ollama

Ollama ermöglicht es, die Standardlänge beim Start des Servers festzulegen, sie für eine Sitzung zu ändern oder sie pro Anfrage über die API anzugeben.

Drei Möglichkeiten, den Kontext in Ollama festzulegen
# Valeur par défaut pour tout le serveur
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

# Pour une session interactive
>>> /set parameter num_ctx 16384

# Pour un modèle personnalisé (Modelfile)
FROM qwen3:8b
PARAMETER num_ctx 16384

Führen Sie nach dem Laden ollama ps aus: Die Spalte CONTEXT zeigt die zugewiesene Länge an, und die Spalte PROCESSOR gibt die Verteilung zwischen GPU und CPU an. Wenn ein Teil auf der CPU läuft, reduzieren Sie den Kontext oder wählen Sie ein kleineres Modell.

#Unter LM Studio

In LM Studio wird die Kontextlänge beim Laden des Modells in den Ladeeinstellungen festgelegt. Eine Änderung des Werts erfordert, das Modell neu zu laden. Achten Sie vor der Bestätigung auf die angezeigte Speicherschätzung.

#Ein vierstufiger Einstellungsprozess

  1. 01
    Den tatsächlichen Bedarf messen
    Senden Sie Ihr Dokument oder Ihren typischen Gesprächsverlauf und lesen Sie prompt_eval_count ab. Rechnen Sie die erwartete Antwortlänge hinzu sowie die Länge der Denkphase, falls das Modell eine solche erzeugt.
  2. 02
    Fenster auswählen
    Wählen Sie den kleinsten Wert, der diese Gesamtmenge mit 20 % Reserve abdeckt. Wenn Sie einen Agenten oder ein Programmierwerkzeug verwenden, wählen Sie mindestens 64.000 Tokens, wie von Ollama empfohlen.
  3. 03
    Speicher prüfen
    Laden Sie das Modell mit diesem Kontextfenster und führen Sie ollama ps aus. Die Prozessoranzeige muss 100 % GPU anzeigen; andernfalls verkleinern Sie das Fenster, quantisieren Sie den Cache oder wechseln Sie zu einem anderen Modell.
  4. 04
    Den Abruf von Informationen testen
    Platzieren Sie eine präzise Information in der Mitte eines langen Textes und fragen Sie nach dieser Information. Wenn das Modell sie nicht findet, ist das angegebene Kontextfenster größer als der Bereich, den es tatsächlich nutzt. Dann ist eine Aufteilung des Textes oder ein RAG erforderlich.

#Ein großes Kontextfenster bedeutet nicht, dass Inhalte zuverlässig gelesen werden

Eine Studie aus dem Jahr 2023 mit dem Titel „Lost in the Middle“ zeigt, dass die Leistung von Modellen je nach Position der Information im Kontext deutlich abnehmen kann: Sie ist oft besser, wenn die Information am Anfang oder am Ende steht, und verschlechtert sich, wenn sie in der Mitte liegt, selbst bei Modellen, die mit einem langen Kontext beworben werden. Der 2024 veröffentlichte Benchmark RULER geht noch weiter: Fast alle getesteten Modelle verlieren bei zunehmender Länge deutlich an Genauigkeit, und nur die Hälfte von ihnen hält bei 32.000 Tokens ein zufriedenstellendes Niveau, obwohl für alle 32.000 Tokens oder mehr angekündigt waren.

Diese Arbeiten beziehen sich auf Modelle ihrer Zeit und sagen nichts über die Modelle von 2026 aus, von denen mehrere speziell für lange Kontexte trainiert wurden. Die empfohlene Vorgehensweise bleibt jedoch gültig: Platzieren Sie die Anweisung und die entscheidenden Fakten am Anfang, wiederholen Sie die Frage am Ende und führen Sie Messungen mit Ihren Dokumenten durch, bevor Sie sich auf ein angegebenes Kontextfenster von mehreren Hunderttausend Tokens verlassen. Der einfachste Test besteht darin, eine konkrete Information in der Mitte eines langen Textes aus Ihrem Fachgebiet unterzubringen und anschließend erneut danach zu fragen: Findet das Modell sie bei jedem Versuch, ist das Kontextfenster für Ihren Einsatzzweck nutzbar; findet es sie nicht, verkürzen Sie den übermittelten Text oder teilen Sie ihn in Abschnitte auf.

#Wenn der Inhalt überläuft

Fortlaufend zusammenfassen
Lassen Sie alle paar Gesprächsrunden eine Zusammenfassung des Austauschs erstellen und setzen Sie das Gespräch mit dieser Zusammenfassung am Anfang des Kontexts fort: Sie verlieren Details, behalten aber den roten Faden.
Das Dokument aufteilen
Ein langes PDF wird Abschnitt für Abschnitt verarbeitet, anschließend werden die Teilantworten zusammengeführt. Der Leitfaden zum Chunking erläutert die geeigneten Größen.
Wechsel zu RAG
Wenn das Korpus deutlich größer als das Kontextfenster ist, werden die wenigen relevanten Passagen abgerufen, statt das gesamte Korpus zu übermitteln.
Ein Modell mit größerem Kontext auswählen
Nur wenn genügend Speicher vorhanden ist: Ziehen Sie die obige Berechnung des KV-Caches heran, bevor Sie das Kontextfenster verdoppeln.
FAQ
Was ist das Kontextfenster eines LLM?+
Das ist die maximale Anzahl an Tokens, die das Modell auf einmal verarbeitet: Systemnachricht, Verlauf, beigefügte Dokumente, Frage und laufende Antwort. Wird diese Grenze überschritten, wird der Anfang abgeschnitten oder die Anfrage abgelehnt. Das Kontextfenster begrenzt, was das Modell lesen kann, nicht das, was es während seines Trainings gelernt hat.
Welche Standardkontextlänge hat Ollama?+
Sie hängt vom Videospeicher ab: 4.000 Tokens bei weniger als 24 GiB VRAM, 32.000 zwischen 24 und 48 GiB, 256.000 bei mehr als 48 GiB. Ollama empfiehlt mindestens 64.000 Tokens für Agenten, Webrecherche und Programmierwerkzeuge. Sie können sie mit OLLAMA_CONTEXT_LENGTH oder num_ctx ändern.
Wie kann der Kontext eines lokalen Modells erhöht werden?+
Setzen Sie OLLAMA_CONTEXT_LENGTH beim Start des Servers, verwenden Sie /set parameter num_ctx in einer interaktiven Sitzung oder deklarieren Sie PARAMETER num_ctx in einem Modelfile. Prüfen Sie anschließend mit ollama ps, ob das Modell vollständig auf der GPU bleibt: Ein längerer Kontext benötigt mehr Speicher und kann dazu führen, dass das Modell teilweise auf die CPU ausgelagert wird.
Wie viel VRAM verbraucht ein Kontext von 32.000 Tokens?+
Das hängt von der Architektur ab. Für Qwen3-8B erreicht der KV-Cache in FP16 bei 32.768 Tokens etwa 4,5 GiB zusätzlich zu den Gewichten. Die Formel lautet: 2 × Anzahl der Schichten × Anzahl der KV-Heads × Dimension eines Heads × 2 Byte pro Token. Die Quantisierung des Caches mit q8_0 halbiert diesen Speicherbedarf ungefähr.
Macht ein größeres Kontextfenster das Modell intelligenter?+
Nein. Ein größerer Kontext ermöglicht dem Modell, mehr Text zu lesen, aber nicht, besser zu schlussfolgern. Im Gegenteil: Die Studien „Lost in the Middle“ und RULER zeigen, dass die Genauigkeit sinken kann, wenn der Kontext länger wird. Wählen Sie das für Ihre Aufgabe benötigte Kontextfenster, nicht das größtmögliche.
Braucht man RAG oder ein großes Kontextfenster, um Dokumente zu analysieren?+
Wenn das Dokument mit etwas Spielraum in das Kontextfenster passt und Sie genügend Speicher haben, ist es einfacher, es vollständig zu senden. Wenn es darüber hinausgeht oder Sie eine Sammlung vieler Dateien abfragen möchten, ist RAG sparsamer und oft zuverlässiger, da es nur die relevanten Passagen übermittelt.

#Weiterführende Informationen

Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.