Zurück zum Archiv

Token

Token

Du fügst einen Satz in den Chat ein, und der Zähler zeigt mehr als zehn Einheiten. Warum nicht genauso viele wie Wörter? Der Computer braucht eine festgelegte Art der Textaufteilung, die auch seltene Namen, Satzzeichen und Codefragmente bewältigt.

Eine solche Einheit ist ein Token: ein Textstück aus dem Vokabular des jeweiligen Modells. Es kann ein ganzes Wort, einen Wortteil, ein Zeichen oder ein Leerzeichen mit den folgenden Buchstaben umfassen. Ein Programm namens Tokenizer teilt den Text auf und verwandelt die Stücke in Zahlen; erst diese Zahlen gelangen in das Modell.

Zum Beispiel lässt sich „Ich lese Bücher.“ zur Veranschaulichung in Ich, le, se, Bü, cher, . aufteilen. Das sind sechs Tokens, obwohl der Satz drei Wörter hat. Die tatsächliche Aufteilung hängt vom Tokenizer ab — dieses Beispiel ist kein Ergebnis eines konkreten Modells. Ein Modell, das eine Antwort erzeugt, sagt solche Stücke nacheinander voraus; das Programm setzt sie wieder zu Text zusammen.

Tokens helfen, die Längenbegrenzungen von Gesprächen und die Gebührenberechnung vieler Dienste zu verstehen. Die Wortzahl allein genügt nicht zu ihrer Schätzung. Ein Token ist eine Einheit der Darstellung, keine Bedeutungseinheit: Ein Wortstück muss keine eigene Bedeutung haben. Wie eine solche Aufteilung entsteht, beschreibt Byte Pair Encoding. Die Hugging-Face-Dokumentation erklärt Tokenisierung und ihre Varianten.

Verbindungen

Tokenarten in LLMs