Borde de estabilidad
Borde de estabilidad
Durante el entrenamiento, el modelo mejora sus pesos con pequeños pasos. Esperas que el error disminuya con calma. Sin embargo, en algunos experimentos el resultado oscila, las condiciones locales parecen inestables y aun así el entrenamiento progresa. ¿Cómo describir esta observación?
Edge of Stability es un régimen de aprendizaje en el que la mayor curvatura local de la función de error se mantiene cerca del límite de estabilidad del paso usado. La curvatura indica lo rápidamente que cambia la orientación de «hacia dónde mejorar los pesos». En una superficie pronunciada, el mismo paso puede saltar por encima del mínimo con más facilidad.
Para el gradient descent habitual —la actualización de los pesos en la dirección que reduce el error—, el límite local en un modelo cuadrático sencillo es 2/η, donde η es el tamaño del paso de aprendizaje. Cohen y colaboradores, §2–3, observaron que se permanecía cerca de ese límite y había oscilaciones pese a la reducción del error a largo plazo.
Es una descripción de la dinámica, no una recomendación de desestabilizar el entrenamiento intencionadamente. El resultado del gradient descent completo no puede trasladarse sin comprobarlo a todos los optimizadores y LLM. Scaling Laws trata de las relaciones entre recursos y resultado; aquí preguntamos por la evolución del propio aprendizaje.