Escalado en tiempo de inferencia
El modelo responde mal a una tarea difícil. En lugar de construir inmediatamente un modelo mayor, le das más tiempo: puede preparar varias soluciones, compararlas o realizar una comprobación adicional. ¿Mejorará el resultado un presupuesto de trabajo mayor?
Test-time scaling consiste en aumentar los cálculos durante la resolución de una tarea por un sistema ya entrenado. Se pueden alargar los pasos sucesivos de trabajo o ejecutar más intentos en paralelo. Se refiere a cómo se usa el presupuesto de Test-time Compute.
Ejemplo: en lugar de una respuesta a un problema matemático, se generan ocho propuestas y un programa verificador elige la que cumple las condiciones. Más intentos solo aumentan la probabilidad de encontrar una buena solución si el modelo puede producirla y la selección realmente la reconoce. Ocho errores idénticos ayudan poco.
Snell y colaboradores, §3–5, estudian el reparto de ese presupuesto. La ventaja depende de la tarea y el procedimiento; una respuesta más larga no demuestra por sí sola un razonamiento mejor. En esta distinción, los pesos del modelo permanecen fijos. Entrenarlos durante una tarea nueva es Test-time training.
Relaciones
Prefix Sliding. El razonamiento puede ser largo; la memoria no [Polski]