Back to archive
#ai#llm#glossary#aigen

Time to First Token

Time to First Token (TTFT) to czas od ustalonego początku obsługi żądania do pojawienia się pierwszego tokena odpowiedzi. W pomiarze po stronie klienta przyjmujemy: wysłanie żądania → odebranie pierwszej niepustej treści odpowiedzi. Dokumentacja NVIDIA NIM Benchmarking, „Time to First Token” opisuje ten zakres i zaznacza, że pusty komunikat nie jest pierwszym tokenem.

Pierwszy złoty kwadrat przechodzi przez przewężenie klepsydry, choć większość zawartości pozostaje u góry.

TTFT obejmuje więcej niż Prefill: klient może czekać na sieć, przygotowanie wejścia, kolejkę, obliczenia i przesłanie wyniku. Pomiar rozpoczynany dopiero wewnątrz serwera ma inne granice. Nie należy porównywać takich liczb bez sprawdzenia, skąd pochodzą ich znaczniki czasu.

Pierwszy znak szybko, cała odpowiedź późno

Własny ślad zdarzeń: wysłanie w 0 ms, dotarcie do serwera w 30 ms, przygotowanie przez 10 ms, kolejka 200 ms, Prefill 120 ms, przygotowanie pierwszego wyniku 5 ms i dostarczenie go przez 35 ms. TTFT klienta wynosi 400 ms; czas od dotarcia żądania do przygotowania wyniku w serwerze to 335 ms.

Po pierwszym tokenie odbieramy jeszcze cztery, co 20 ms. Cała odpowiedź dociera w 480 ms. Zwiększ ich odstępy do 100 ms: koniec przesunie się do 800 ms, ale pierwszy token nadal nadejdzie w 400 ms. Następnie zwiększ kolejkę i zobacz, które wyniki zmienią się razem.

Czasy są syntetyczne, etapy rozłączne, a każdy komunikat zawiera jeden token. Rzeczywisty streaming może grupować tokeny. TTFT nie opisuje rytmu Decode ani czasu otrzymania całej odpowiedzi; dokumentacja rozdziela te metryki w sekcjach „Inter-token Latency” i „End-to-End Request Latency”. Prefix Caching może zmniejszyć pracę nad promptem, a Continuous Batching wpływa na to, kiedy scheduler dopuści żądanie do wykonania.

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.