Tokenarten in LLMs
Tokens sind die grundlegenden Einheiten der Textverarbeitung in Sprachmodellen. Sie lassen sich nach Rolle, Sichtbarkeit und Funktion einteilen.
1. Einteilung nach dem Verarbeitungsfluss
| Typ | Beschreibung | Kostenpflichtig? | Beispiel |
|---|---|---|---|
| Input | Tokens aus der Anfrage oder dem Prompt | Ja | „Verarbeite diesen Text:“ |
| Output | Vom Modell erzeugte Tokens | Ja | „Hier ist die Antwort.“ |
| Context | Summe aus Input, Gesprächsverlauf und Output im Kontextfenster | Ja | Die gesamte Unterhaltung |
| Cached | Eingabetokens, die das System als bereits verarbeitet erkannt hat und wiederverwenden kann | Ja, aber meist günstiger | Derselbe Systemprompt oder ein unveränderter Teil eines langen Kontexts |
2. Spezialtokens und Systemtokens
- Systemtokens — definieren die Rolle des Modells, zum Beispiel: „Du bist ein Experte“.
- Spezialtokens — technische Markierungen wie
<|endoftext|>,<|im_start|>und<|im_end|>, die die Datenstruktur beschreiben. - Thinking / Reasoning — verborgene Tokens, die das Modell beim Schlussfolgern verwendet.
- Planning / Critical — Tokens, die die Planung oder wichtige logische Schritte der Antwort unterstützen.
3. Einteilung nach Tokenisierung
| Methode | Granularität | Vorteile | Nachteile |
|---|---|---|---|
| Wörter | Ganze Wörter | Einfacher Ansatz | Schwächer bei neuen und seltenen Wörtern |
| Subwords (BPE) | Wortteile | Flexibel, häufig in LLMs verwendet | Komplexer |
| Zeichen | Einzelne Buchstaben | Universell | Erzeugen wesentlich mehr Tokens |
Die ökonomische Regel
Input + Cached + Output ≤ Kontextfenster des Modells
zum Beispiel 128K Tokens.
Was bedeuten Cached Tokens in der Praxis?
Cached Tokens sind Teile der Eingabe, die sich zwischen aufeinanderfolgenden Modellaufrufen nicht verändert haben.
Meist geht es um:
- denselben Systemprompt
- denselben Gesprächsverlauf
- dieselben Anweisungen oder Dokumente, die mehreren Anfragen beigefügt werden
Dadurch muss das System nicht immer alles von Grund auf neu berechnen, und ein solcher Teil kann günstiger abgerechnet werden. Nicht alle Modelle unterstützen das.
Praktische Regel
Je mehr fester, unveränderlicher Kontext zwischen Anfragen besteht, desto größer die Chance, Cached Tokens zu nutzen und die Kosten zu senken.