Back to archive
#ai#llm#glossary#aigen

Time to First Token

Klikasz „Wyślij” i patrzysz na pusty czat. Dla komfortu użytkownika ważne jest, kiedy pojawi się początek odpowiedzi, nawet jeśli cała będzie pisała się znacznie dłużej. Potrzebujesz pomiaru tego pierwszego oczekiwania.

Time to First Token (TTFT) to czas od określonego początku obsługi do pierwszego tokena, czyli fragmentu odpowiedzi. W opisanym pomiarze klienta zaczynamy przy wysłaniu żądania, a kończymy przy pierwszej niepustej treści.

Jeśli pytanie wysłano o 0 ms, a pierwszy tekst przyszedł o 800 ms, TTFT wynosi 800 ms. W tej liczbie mogą być sieć, kolejka, przygotowanie wejścia i obliczenia. Pomiar samego czasu modelu miałby inne granice.

Małe TTFT nie gwarantuje płynnej reszty: po pierwszym fragmencie może nastąpić długa pauza. To opisuje Inter-token Latency. Przy porównaniu trzeba zawsze podać, skąd i dokąd mierzono czas.

Źródło mechanizmu: Dokumentacja NVIDIA NIM Benchmarking, „Time to First Token”.

Mechanizm i szczegóły

Pierwszy złoty kwadrat przechodzi przez przewężenie klepsydry, choć większość zawartości pozostaje u góry.

TTFT obejmuje więcej niż Prefill: klient może czekać na sieć, przygotowanie wejścia, kolejkę, obliczenia i przesłanie wyniku. Pomiar rozpoczynany dopiero wewnątrz serwera ma inne granice. Nie należy porównywać takich liczb bez sprawdzenia, skąd pochodzą ich znaczniki czasu.

Pierwszy znak szybko, cała odpowiedź późno

Własny ślad zdarzeń: wysłanie w 0 ms, dotarcie do serwera w 30 ms, przygotowanie przez 10 ms, kolejka 200 ms, Prefill 120 ms, przygotowanie pierwszego wyniku 5 ms i dostarczenie go przez 35 ms. TTFT klienta wynosi 400 ms; czas od dotarcia żądania do przygotowania wyniku w serwerze to 335 ms.

Po pierwszym tokenie odbieramy jeszcze cztery, co 20 ms. Cała odpowiedź dociera w 480 ms. Zwiększ ich odstępy do 100 ms: koniec przesunie się do 800 ms, ale pierwszy token nadal nadejdzie w 400 ms. Następnie zwiększ kolejkę i zobacz, które wyniki zmienią się razem.

Czasy są syntetyczne, etapy rozłączne, a każdy komunikat zawiera jeden token. Rzeczywisty streaming może grupować tokeny. TTFT nie opisuje rytmu Decode ani czasu otrzymania całej odpowiedzi; dokumentacja rozdziela te metryki w sekcjach „Inter-token Latency” i „End-to-End Request Latency”. Inter-token Latency opisuje odstępy i pauzy po pierwszym tokenie. Prefix Caching może zmniejszyć pracę nad promptem, a Continuous Batching wpływa na to, kiedy scheduler dopuści żądanie do wykonania.

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.