Volver al archivo

Grokking

Grokking

El modelo responde sin errores a las tareas usadas para aprender, pero se equivoca en ejemplos nuevos del mismo tipo. Parece que haya memorizado una tabla de respuestas. El entrenamiento continúa y solo mucho después mejoran bruscamente los resultados en los ejemplos nuevos.

Esa mejora tardía de la generalización, es decir, del comportamiento ante datos no vistos, se llama Grokking. Importa la diferencia entre el éxito rápido en el conjunto de entrenamiento y el éxito posterior fuera de él.

En una tarea aritmética sencilla, el modelo puede ajustar primero las respuestas a las parejas de números conocidas y solo después aprender una estructura que le permita resolver parejas nuevas. Power y colaboradores, §2–3, estudian esta evolución en pequeñas tareas algorítmicas. Descubrir una regla es una intuición que ayuda a interpretar el resultado, no una prueba de «comprensión» humana en el modelo.

Por tanto, para reconocer el grokking necesitamos dos mediciones: el resultado en los datos de entrenamiento y en datos separados de evaluación. Reducir solo el error de entrenamiento no basta. El fenómeno no aparece en todos los entrenamientos ni promete que cualquier modelo sobreajustado mejorará con solo esperar más.

Relaciones

Neural Feature Ansatz