Zurück zum Archiv

Tokenarten in LLMs

Tokens sind die grundlegenden Einheiten der Textverarbeitung in Sprachmodellen. Sie lassen sich nach Rolle, Sichtbarkeit und Funktion einteilen.

1. Einteilung nach dem Verarbeitungsfluss

TypBeschreibungKostenpflichtig?Beispiel
InputTokens aus der Anfrage oder dem PromptJa„Verarbeite diesen Text:“
OutputVom Modell erzeugte TokensJa„Hier ist die Antwort.“
ContextSumme aus Input, Gesprächsverlauf und Output im KontextfensterJaDie gesamte Unterhaltung
CachedEingabetokens, die das System als bereits verarbeitet erkannt hat und wiederverwenden kannJa, aber meist günstigerDerselbe Systemprompt oder ein unveränderter Teil eines langen Kontexts

2. Spezialtokens und Systemtokens

  • Systemtokens — definieren die Rolle des Modells, zum Beispiel: „Du bist ein Experte“.
  • Spezialtokens — technische Markierungen wie <|endoftext|>, <|im_start|> und <|im_end|>, die die Datenstruktur beschreiben.
  • Thinking / Reasoning — verborgene Tokens, die das Modell beim Schlussfolgern verwendet.
  • Planning / Critical — Tokens, die die Planung oder wichtige logische Schritte der Antwort unterstützen.

3. Einteilung nach Tokenisierung

MethodeGranularitätVorteileNachteile
WörterGanze WörterEinfacher AnsatzSchwächer bei neuen und seltenen Wörtern
Subwords (BPE)WortteileFlexibel, häufig in LLMs verwendetKomplexer
ZeichenEinzelne BuchstabenUniversellErzeugen wesentlich mehr Tokens

Die ökonomische Regel

Input + Cached + Output ≤ Kontextfenster des Modells
zum Beispiel 128K Tokens.

Was bedeuten Cached Tokens in der Praxis?

Cached Tokens sind Teile der Eingabe, die sich zwischen aufeinanderfolgenden Modellaufrufen nicht verändert haben.

Meist geht es um:

  • denselben Systemprompt
  • denselben Gesprächsverlauf
  • dieselben Anweisungen oder Dokumente, die mehreren Anfragen beigefügt werden

Dadurch muss das System nicht immer alles von Grund auf neu berechnen, und ein solcher Teil kann günstiger abgerechnet werden. Nicht alle Modelle unterstützen das.

Praktische Regel

Je mehr fester, unveränderlicher Kontext zwischen Anfragen besteht, desto größer die Chance, Cached Tokens zu nutzen und die Kosten zu senken.

Tokenökonomie

Token