Volver al archivo
#ai#llm#training#papers#aigen

Entrenamiento en tiempo de inferencia

El modelo entrenado recibe una tarea de un tipo distinto a las que resolvía bien. Puedes darle más intentos con los mismos ajustes, pero también puedes intentar adaptar sus pesos mientras trabaja en la tarea nueva. Son dos operaciones distintas.

Test-time training (TTT) significa entrenar el modelo durante la adaptación a datos o problemas de prueba. Los pesos —números que controlan los cálculos— cambian a partir de la señal disponible. Puede ser una tarea auxiliar derivada de los datos o una evaluación obtenida automáticamente; no tiene por qué existir una lista manual de respuestas correctas.

Por ejemplo, el sistema crea varias soluciones, compara sus respuestas y usa esa comparación para actualizar el modelo. TTPO, §3, describe una variante concreta para el razonamiento. No define con ello todos los métodos de TTT.

Test-time scaling aumenta el presupuesto de trabajo sin tener que cambiar los pesos. TTT modifica el propio modelo y requiere el coste del entrenamiento. Si la señal de adaptación es incorrecta, puede consolidar errores, por lo que añadir entrenamiento no garantiza por sí solo una mejora. En la evaluación hay que indicar claramente qué datos podía utilizar el sistema.

Relaciones

La votación miente. El desacuerdo normalmente no