Zurück zum Archiv
#ai#llm#glossary#aigen

Zeit bis zum ersten Token

Du klickst auf „Senden“ und schaust auf einen leeren Chat. Für den Nutzerkomfort ist entscheidend, wann der Anfang der Antwort erscheint, auch wenn die gesamte Antwort deutlich länger braucht. Du benötigst eine Messung dieser ersten Wartezeit.

Time to First Token (TTFT) ist die Zeit von einem festgelegten Beginn der Bearbeitung bis zum ersten Token, also einem Antwortfragment. Bei der beschriebenen Messung auf Clientseite beginnen wir mit dem Absenden der Anfrage und enden mit dem ersten nicht leeren Inhalt.

Wenn die Frage bei 0 ms gesendet wurde und der erste Text bei 800 ms eintraf, beträgt TTFT 800 ms. In dieser Zahl können Netzwerk, Warteschlange, Eingabevorbereitung und Berechnungen enthalten sein. Eine Messung der reinen Modellzeit hätte andere Grenzen.

Ein kleines TTFT garantiert keinen flüssigen weiteren Verlauf: Nach dem ersten Fragment kann eine lange Pause folgen. Das beschreibt Inter-token Latency [Polski]. Bei Vergleichen muss immer angegeben werden, von welchem bis zu welchem Zeitpunkt gemessen wurde.

Quelle des Mechanismus: NVIDIA NIM Benchmarking-Dokumentation, „Time to First Token“.

Mechanismus und Details

Das erste goldene Quadrat passiert die Engstelle einer Sanduhr, obwohl der Großteil des Inhalts noch oben liegt.

TTFT umfasst mehr als Prefill: Der Client kann auf Netzwerk, Eingabevorbereitung, Warteschlange, Berechnungen und Ergebnisübertragung warten. Eine erst im Server beginnende Messung hat andere Grenzen. Solche Zahlen dürfen nicht verglichen werden, ohne die Herkunft ihrer Zeitstempel zu prüfen.

Das erste Zeichen schnell, die ganze Antwort spät

Eigene Ereignisspur: Senden bei 0 ms, Serverankunft bei 30 ms, Vorbereitung für 10 ms, Warteschlange 200 ms, Prefill 120 ms, Vorbereitung des ersten Ergebnisses 5 ms und dessen Lieferung 35 ms. Die Client-TTFT beträgt 400 ms; von der Anfrageankunft bis zum vorbereiteten Serverergebnis vergehen 335 ms.

Nach dem ersten Token empfangen wir vier weitere, alle 20 ms. Die gesamte Antwort trifft nach 480 ms ein. Erhöhe die Abstände auf 100 ms: Das Ende verschiebt sich auf 800 ms, aber das erste Token kommt weiterhin bei 400 ms. Erhöhe dann die Warteschlange und beobachte, welche Ergebnisse sich gemeinsam ändern.

Die Zeiten sind synthetisch, die Phasen überschneiden sich nicht, und jede Nachricht enthält ein Token. Reales Streaming kann Tokens gruppieren. TTFT beschreibt weder den Rhythmus des Decode noch die Zeit bis zum Erhalt der gesamten Antwort; die Dokumentation trennt diese Metriken in den Abschnitten „Inter-token Latency“ und „End-to-End Request Latency“. Inter-token Latency [Polski] beschreibt die Abstände und Pausen nach dem ersten Token. Prefix Caching kann die Arbeit am Prompt verringern, während Continuous Batching beeinflusst, wann der Scheduler eine Anfrage zur Ausführung zulässt.

Ich verwende KI-generierte Inhalte als Teil meines täglichen Lernprozesses.