Tokens und Tokenisierung: verstehen, was ein LLM
Ein LLM liest weder Wörter noch Buchstaben: Es liest Tokens, also Textfragmente, die durch eine sogenannte Tokenisierung entstehen. Diese unsichtbare Einheit bestimmt alles – wie viel sich Ihr Modell merken kann, wie schnell es antwortet und warum derselbe Text auf Französisch mehr „wiegt“ als auf Englisch. Dieser Leitfaden erklärt konkret, was ein Token ist, wie die Tokenisierung eines LLM funktioniert und was das für Sie bedeutet, wenn Sie ein Modell lokal ausführen.
#Warum über Tokens sprechen?
Wenn Sie mit einem lokalen LLM über Ollama oder LM Studio chatten, geben Sie Sätze ein. Das Modell sieht Ihre Sätze jedoch nie in dieser Form. Noch vor der ersten Berechnung wird Ihr Text in eine Folge von Zahlen umgewandelt, von denen jede ein Token repräsentiert. Alles, was das Modell tut – verstehen, generieren –, geschieht auf der Ebene dieser Tokens, nicht auf der Ebene der Wörter.
Tokens zu verstehen ist kein akademisches Detail. Es erklärt drei sehr konkrete Dinge: warum ein Dokument in das Kontextfenster „passt“ oder nicht, warum Ihr Modell mit einer bestimmten Geschwindigkeit generiert (die viel zitierten Tokens pro Sekunde) und warum die Abrechnung einer Cloud-API oder eine Kontextgrenze immer in Tokens angegeben wird, niemals in Wörtern.
#Was genau ist ein Token?
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Ein Token ist ein Textfragment: manchmal ein ganzes Wort, oft ein Wortteil, manchmal ein einzelnes Zeichen oder ein Satzzeichen. Es ist weder ein Buchstabe noch ein Wort im strengen Sinne – es ist eine statistische Einheit, die der Tokenisierungsalgorithmus auswählt, um den Text möglichst effizient darzustellen.
Die nützlichste Faustregel: Im Englischen gilt 1 Token ≈ 4 Zeichen ≈ 0,75 Wörter. Anders gesagt entsprechen 100 Tokens etwa 75 englischen Wörtern. Im Französischen ist das Verhältnis deutlich ungünstiger; darauf kommen wir weiter unten zurück.
- "chat"
- Ein häufiges und kurzes Wort: oft nur 1 Token.
- "anticonstitutionnellement"
- Ein seltener, langer Begriff: aufgeteilt in mehrere Tokens (anti / constitution / nelle / ment…).
- " " (Leerzeichen)
- Das Leerzeichen steht normalerweise am Anfang des nächsten Tokens und bildet kein eigenes Token.
- "123456"
- Zahlen werden oft Ziffer für Ziffer oder in kleinen Gruppen aufgeteilt.
- 😀
- Ein Emoji kann allein mehrere Tokens kosten.
Sehr häufige Wörter erhalten ein einzelnes Token, weil sie überall in den Trainingsdaten vorkommen. Seltene oder technische Wörter sowie Wörter aus einer wenig vertretenen Sprache werden aus kleineren Teilstücken zusammengesetzt — dadurch sind sie in Tokens gerechnet „teurer“.
#Wie ein Text tatsächlich aufgeteilt wird
Die meisten modernen LLM verwenden eine Familie von Algorithmen namens BPE (Byte Pair Encoding) oder deren Varianten (WordPiece, Unigram). Das Prinzip: mit den unverarbeiteten Zeichen beginnen und dann schrittweise die häufigsten Symbolpaare im Trainingskorpus zusammenführen, bis ein Vokabular fester Größe entsteht – je nach Modell typischerweise mit 32.000 bis 200.000 Tokens.
- 01Anfängliche ZerlegungDer Text wird in seine grundlegenden Bytes oder Zeichen zerlegt. Nichts geht verloren: Jede Zeichenkette kann dargestellt werden.
- 02Gelernte ZusammenführungenDer Tokenizer wendet die beim Training erlernte Liste von Zusammenführungen (z. B. „t“ + „ion“ → „tion“) in der Reihenfolge ihrer Häufigkeit an.
- 03Konvertierung in IdentifikatorenJeder endgültige Token wird durch seine Nummer im Vokabular ersetzt. Das Modell arbeitet nun ausschließlich mit diesen ganzen Zahlen.
Eine wichtige Konsequenz: Das Vokabular wird beim Training festgelegt und bleibt danach unverändert. Ein Modell, das hauptsächlich mit englischen Texten trainiert wurde, hat ein für Englisch optimiertes Vokabular und zerlegt französische Texte in kleinere und zahlreichere Stücke. Darin liegt die Ursache für die Mehrkosten bei französischsprachigen Texten.
#Warum Französisch teurer ist als Englisch
Bei gleichem Inhalt verbraucht ein französischer Text häufig 15 bis 30 % mehr Tokens als seine englische Übersetzung. Bei einigen sehr englisch orientierten Modellen kann der Unterschied über 50 % liegen. Drei Gründe addieren sich dabei.
- Unausgewogenes Vokabular
- Die Tokenisierer wurden hauptsächlich auf Englisch trainiert: Häufige englische Wörter erhalten einen eigenen Token, französische Wörter nicht.
- Akzente und Sonderzeichen
- é, è, à, ç, œ… sind seltener im Vokabular und werden manchmal in mehrere Tokens (bis hin zu Bytes) aufgeteilt.
- Reichere Morphologie
- Konjugationen, grammatische Kongruenz und Elisionen (l', d', qu') vervielfachen die Formen eines Wortes, die im Vokabular weniger gut abgedeckt sind.
Ein konkretes Beispiel: Der englische Satz „The cat is on the table“ besteht aus etwa 6 Tokens. Seine französische Version „Le chat est sur la table“ kommt je nach Modell eher auf 7 bis 8 Tokens. Bei einem ganzen Absatz wird der Unterschied erheblich – und er kostet Sie gleich zweimal etwas: Platz im Kontextfenster und Zeit bei der Generierung.
#Tokens und Kontextfenster
Das Kontextfenster eines Modells wird in Token gemessen, nicht in Wörtern oder Zeichen. Ein Modell, für das ein Kontextfenster von 32.768 Token angegeben wird, kann zu einem bestimmten Zeitpunkt das Äquivalent von etwa 24.000 englischen Wörtern „sehen“ – aber nur etwa 18.000 bis 20.000 französischen Wörtern, weil die Tokenisierung dafür mehr Token benötigt.
Dieses Fenster umfasst alles: den System-Prompt, den Gesprächsverlauf, Ihre aktuelle Nachricht, die eingefügten Dokumente und die Antwort, die gerade generiert wird. Wenn die Gesamtmenge die Grenze überschreitet, kürzt das Modell den Inhalt – in der Regel die ältesten Teile – und „vergisst“ den Anfang des Gesprächs.
- System prompt
- Wird bei jedem Aufruf mitgezählt. Ein weitschweifiger Systemprompt beansprucht ständig Platz im Kontextfenster.
- Verlauf
- Mit jeder Gesprächsrunde wächst der Verlauf. Eine lange Unterhaltung füllt schließlich das Kontextfenster.
- Dokumente (RAG, Kopieren und Einfügen)
- Ein PDF mit 10 Seiten umfasst schnell mehrere Tausend Tokens.
- Generierte Antwort
- Auch die Ausgabe benötigt Platz: Für die Antwort muss genügend Platz reserviert werden.
#Tokens und Geschwindigkeit beim lokalen Betrieb
Die Geschwindigkeit eines LLM wird in Tokens pro Sekunde (tok/s) gemessen. Das ist die universelle Einheit für Benchmarks. Zwei oft verwechselte Phasen sind zu unterscheiden.
- Prompt / Prefill
- Die Zeit, die benötigt wird, um Ihren gesamten Prompt zu „lesen“. Je mehr Tokens die Eingabe enthält, desto länger dauert es, bis die erste Antwort beginnt.
- Generierung / Decodierung
- Die Geschwindigkeit, mit der die Antworttokens nacheinander ausgegeben werden. Das ist die Anzahl der Tokens pro Sekunde (tok/s), die man auf dem Bildschirm beobachtet.
Die direkte Folge für Französisch: Da derselbe Inhalt mehr Tokens umfasst, benötigt Ihr Modell zwangsläufig mehr Zeit, um einen französischsprachigen Prompt zu verarbeiten und eine französischsprachige Antwort gleicher Länge zu generieren. Der Eindruck „Auf Französisch ist es langsamer“ ist nicht subjektiv – er ergibt sich aus der Anzahl der Tokens.
Die Decodierungsgeschwindigkeit hängt vor allem vom Modell und der Hardware ab (aktive Parameter pro Token, Speicherbandbreite, Quantisierung). Bei unveränderter Hardware verkürzt eine geringere Anzahl von Eingabetokens – ein kürzerer Systemprompt, ein gekürzter Gesprächsverlauf – jedoch deutlich die Zeit bis zum ersten Token.
#Anzahl der Tokens eines Textes selbst berechnen
Am besten entwickelt man ein Gespür dafür, indem man misst. Hier sind drei Ansätze, vom einfachsten bis zum genauesten.
#Grob schätzen
Für eine schnelle Schätzung, ohne etwas zu installieren: Teilen Sie die Anzahl der Zeichen bei englischen Texten durch 4, bei französischen Texten durch 3 bis 3,5. Das ist grob, reicht aber aus, um festzustellen, ob ein Dokument in ein Kontextfenster passt.
#In Python mit dem tatsächlichen Tokenizer zählen
Für eine exakte Zählung verwenden Sie den Tokenizer des Modells. Die Bibliothek tokenizers / transformers von Hugging Face lädt den tatsächlichen Tokenizer eines Open-Weight-Modells:
Dieses Skript mit Ihren eigenen Texten auszuführen, ist die anschaulichste Übung: Sie sehen mit eigenen Augen, welche französischen Wörter zerlegt werden und um wie viel kompakter Englisch ist.
#Die Tokenanzahl über die Ollama-API auslesen
Ollama liefert die Token-Zahlen bereits in seinen Antworten mit. Der Daemon lauscht standardmäßig auf http://localhost:11434; ein API-Aufruf gibt prompt_eval_count (Tokens des Prompts) und eval_count (generierte Tokens) zurück:
Dort finden Sie auch eval_duration: Teilen Sie eval_count durch die Dauer, um den tatsächlichen Durchsatz in Tokens pro Sekunde auf Ihrem Rechner mit Ihrer Quantisierung zu erhalten.
#Tokens sparen, ohne an Qualität einzubüßen
Da jedes Token Kontextplatz beansprucht und die Verarbeitung verlangsamt, machen einige einfache Gewohnheiten einen echten Unterschied, besonders bei französischen Texten.
- Kompakter Systemprompt
- Er wird bei jedem Aufruf erneut mitgesendet. Jeder überflüssige Satz verursacht in jeder Gesprächsrunde Kosten.
- Den Gesprächsverlauf kürzen
- Fassen Sie ältere Gesprächsbeiträge zusammen oder entfernen Sie sie, statt immer den gesamten Gesprächsverlauf mitzuschleppen.
- RAG statt alles einzufügen
- Fügen Sie nur relevante Abschnitte eines Dokuments hinzu, nicht das gesamte Dokument.
- Länge der Ausgabe festlegen
- Wenn Sie um eine kurze Antwort bitten, werden weniger Tokens erzeugt — die Generierung geht also schneller.
#Weiterführende Informationen
Tokens sind der Faden, der mehrere Grundkonzepte miteinander verbindet. Drei Leitfäden führen diesen direkt weiter: Der erste erläutert das Kontextfenster, das die Tokens füllen, der zweite erklärt, wie die Quantisierung die in Tokens pro Sekunde gemessene Geschwindigkeit beeinflusst, und der dritte zeigt, wie der Transformer diese Tokens intern verarbeitet.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.