Volver al archivo
#ai#llm#training#papers#aigen

Decaimiento de pesos

El modelo ajusta cada vez mejor los datos y los pesos —números que controlan los cálculos— se alejan de cero. Quieres limitar ese crecimiento sin corregir manualmente millones de valores. Necesitas una regla que actúe en cada paso de aprendizaje.

Weight decay atrae los pesos hacia cero. En la variante desacoplada de la corrección propia del algoritmo de aprendizaje, cada peso se multiplica por un factor ligeramente menor que 1 y después se modifica según la información de los datos.

Si el factor de reducción es 0,99, el peso 2 pasa a 1,98 y el peso −2 a −1,98, antes de considerar la corrección del aprendizaje. Por tanto, se reduce la distancia a cero, no siempre el propio valor numérico. Eso no significa que cada peso termine acercándose a cero: la corrección de los datos puede actuar en sentido contrario. La magnitud de esa reducción depende del paso de aprendizaje y del coeficiente de decay elegidos. Loshchilov y Hutter, §2, explican cómo separar weight decay del cambio debido al gradiente.

Controlar la escala de los pesos puede influir tanto en el ajuste a datos nuevos como en la dinámica del entrenamiento. El estudio del paso efectivo de aprendizaje, §4, analizó ese segundo papel. Es un resultado bajo las condiciones estudiadas, no una prueba de que unos pesos menores siempre signifiquen un modelo mejor.

Relaciones

La tasa de aprendizaje no basta. Lo que cuenta es ELR [Polski]

Véase también: AdamW [Polski] —una forma de aplicar weight decay fuera del mecanismo de selección del paso de Adam [Polski]—.