Back to archive
#ai#llm#glossary#aigen

Inter-token Latency

Inter-token Latency (ITL) opisuje opóźnienia między kolejnymi tokenami odpowiedzi. Nazwa bywa używana dla pojedynczych odstępów albo ich średniej, dlatego wynik wymaga podania sposobu obliczenia. NVIDIA NIM Benchmarking, „Inter-token Latency” definiuje średnią bez oczekiwania na pierwszy token, zwaną także Time per Output Token (TPOT).

Dwa rzędy ciemnych punktów mają wspólny początek i koniec, ale w dolnym rytm przerywa szeroka luka.

Dla jednej odpowiedzi z N>1N>1 tokenami, gdy każdy token ma osobny czas odbioru:

ITLavg=tNt1N1\mathrm{ITL}_{\mathrm{avg}}=\frac{t_N-t_1}{N-1}

t1t_1 i tNt_N oznaczają odbiór pierwszego oraz ostatniego tokena. Time to First Token mierzy wcześniejsze oczekiwanie od wysłania żądania. Dodanie tego oczekiwania do licznika zmieni metrykę.

Średnia ukrywa pauzę

Dwa własne ślady pięciu tokenów zaczynają się w 400 ms i kończą w 560 ms. Pierwszy ma odstępy 40, 40, 40, 40 ms. Drugi: 10, 10, 130, 10 ms. Oba dają średnią 40 ms i ten sam czas całej odpowiedzi. W drugim użytkownik doświadcza jednak pauzy ponad trzykrotnie dłuższej niż ta średnia.

Wybierz ślad i odsłoń kolejne odstępy. Czy po poznaniu samego wyniku 40 ms dałoby się odtworzyć taki przebieg?

Token a komunikat strumienia

Klient często odbiera kilka tokenów w jednym komunikacie. Ich indywidualnych czasów powstania nie można odtworzyć z jednego znacznika odbioru. AIPerf, sekcje „Inter Token Latency” i „Inter Chunk Latency” rozdziela średnią normalizowaną liczbą tokenów od odstępów między niepustymi komunikatami. Zapisuj wersję narzędzia, granice pomiaru i sposób agregacji. Percentyl średnich z wielu żądań nie jest percentylem wszystkich odstępów w ich strumieniach.

Obliczenia Decode, scheduler i transport mogą wpływać na rytm odbioru. Chunked Prefill ogranicza porcję nowego promptu współdzielącą iterację z trwającymi odpowiedziami; Disaggregated Serving przenosi te fazy na osobne zasoby.

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.