Volver al archivo
#ai#llm#inference#papers#aigen

Escalado en tiempo de inferencia

El modelo responde mal a una tarea difícil. En lugar de construir inmediatamente un modelo mayor, le das más tiempo: puede preparar varias soluciones, compararlas o realizar una comprobación adicional. ¿Mejorará el resultado un presupuesto de trabajo mayor?

Test-time scaling consiste en aumentar los cálculos durante la resolución de una tarea por un sistema ya entrenado. Se pueden alargar los pasos sucesivos de trabajo o ejecutar más intentos en paralelo. Se refiere a cómo se usa el presupuesto de Test-time Compute.

Ejemplo: en lugar de una respuesta a un problema matemático, se generan ocho propuestas y un programa verificador elige la que cumple las condiciones. Más intentos solo aumentan la probabilidad de encontrar una buena solución si el modelo puede producirla y la selección realmente la reconoce. Ocho errores idénticos ayudan poco.

Snell y colaboradores, §3–5, estudian el reparto de ese presupuesto. La ventaja depende de la tarea y el procedimiento; una respuesta más larga no demuestra por sí sola un razonamiento mejor. En esta distinción, los pesos del modelo permanecen fijos. Entrenarlos durante una tarea nueva es Test-time training.

Relaciones

Prefix Sliding. El razonamiento puede ser largo; la memoria no [Polski]