Volver al archivo
#ai#llm#training#papers#aigen

Aceleración retardada

Comparas dos entrenamientos. En el primero limitas el crecimiento de los pesos y en el segundo no. Al principio, el primero obtiene un resultado peor y parece una mala elección. Hacia el final, la situación se invierte: alcanza al segundo y lo supera.

Delayed acceleration denomina una ventaja que solo se hace visible en una fase posterior del entrenamiento, en el estudio del control de la magnitud de los pesos, los números que controlan los cálculos del modelo. El resultado se evalúa mediante la loss, una cifra que mide el error del modelo; una menor significa un mejor ajuste a la tarea estudiada.

Los autores del estudio de ELR, §4, relacionan esta evolución con el paso efectivo de aprendizaje. Cuando los pesos crecen, un cambio de una magnitud dada puede volverse relativamente menor. Weight decay o Hyperball controlan esa escala. Los cambios relativos mayores pueden acelerar la adquisición de una señal útil y al mismo tiempo aumentar las oscilaciones que antes ocultan la ventaja.

Es una explicación de una evolución concreta observada, no una promesa de que toda curva peor acabe siendo mejor. Para comparar métodos, hay que considerar un entrenamiento suficientemente largo y sus ajustes. Interrumpir pronto la medición puede cambiar la evaluación del experimento.

Relaciones

La tasa de aprendizaje no basta. Lo que cuenta es ELR [Polski]

Weight decay

Hyperball