Tiempo hasta el primer token
Pulsas «Enviar» y miras el chat vacío. Para la comodidad del usuario importa cuándo aparece el principio de la respuesta, aunque escribirla entera lleve mucho más tiempo. Necesitas medir esa primera espera.
Time to First Token (TTFT) es el tiempo desde el inicio definido de la atención de una solicitud hasta el primer token, es decir, un fragmento de la respuesta. En la medición del cliente descrita, empezamos al enviar la solicitud y terminamos al recibir el primer contenido no vacío.
Si la pregunta se envió a los 0 ms y el primer texto llegó a los 800 ms, el TTFT es de 800 ms. Esta cifra puede incluir la red, la cola, la preparación de la entrada y los cálculos. Una medición del tiempo del modelo tendría otros límites.
Un TTFT bajo no garantiza que el resto fluya: tras el primer fragmento puede haber una pausa larga. Eso lo describe Inter-token Latency [Polski]. Al comparar, siempre hay que indicar desde dónde y hasta dónde se ha medido el tiempo.
Fuente del mecanismo: documentación de NVIDIA NIM Benchmarking, «Time to First Token».
Mecanismo y detalles

TTFT incluye más que Prefill: el cliente puede esperar a la red, a la preparación de la entrada, a la cola, a los cálculos y al envío del resultado. Una medición que empieza dentro del servidor tiene otros límites. No deben compararse esas cifras sin comprobar de dónde proceden sus marcas de tiempo.
El primer carácter pronto, la respuesta completa tarde
Traza de eventos propia: envío a los 0 ms, llegada al servidor a los 30 ms, preparación de 10 ms, cola de 200 ms, Prefill de 120 ms, preparación del primer resultado de 5 ms y entrega de 35 ms. El TTFT del cliente es 400 ms; el tiempo desde la llegada de la solicitud hasta la preparación del resultado en el servidor es 335 ms.
Después del primer token recibimos cuatro más, uno cada 20 ms. La respuesta completa llega a los 480 ms. Aumenta sus intervalos a 100 ms: el final pasa a los 800 ms, pero el primer token sigue llegando a los 400 ms. Después aumenta la cola y observa qué resultados cambian juntos.
Los tiempos son sintéticos, las etapas no se solapan y cada mensaje contiene un token. El streaming real puede agrupar tokens. TTFT no describe el ritmo de Decode ni el tiempo hasta recibir la respuesta completa; la documentación separa esas métricas en «Inter-token Latency» y «End-to-End Request Latency». Inter-token Latency [Polski] describe los intervalos y las pausas después del primer token. Prefix Caching puede reducir el trabajo sobre el prompt, y Continuous Batching influye en cuándo el scheduler admite la solicitud para su ejecución.
Utilizo contenido generado por IA como parte de mi proceso de aprendizaje diario.