Regularización implícita mediante hiperparámetros
Regularización implícita mediante hiperparámetros
Dos modelos aprenden con los mismos ejemplos y alcanzan un error de entrenamiento parecido, pero uno funciona mejor con datos nuevos. Solo diferían en la forma de realizar el entrenamiento. ¿De dónde puede proceder la diferencia si el objetivo era el mismo?
Implicit Regularization significa la influencia del propio procedimiento de aprendizaje en la elección de la solución. Muchos ajustes de los pesos pueden encajar con los datos. El tamaño del paso de aprendizaje, el número de ejemplos por paso y el azar de su selección pueden hacer que el entrenamiento llegue más a menudo a unas soluciones que a otras.
Piensa en varios caminos que conducen a un resultado igual de bueno en los ejercicios. Cambiar la forma de recorrerlos puede llevar a un lugar distinto, que se comporte de otra manera en una prueba nueva. Es una analogía de la selección de una solución, no conocimiento adicional que se añada al modelo.
Smith y colaboradores, §2–3, analizan esta influencia en stochastic gradient descent [Polski], el aprendizaje con grupos de ejemplos elegidos al azar. No todas las diferencias de ajustes mejoran la generalización. Weight decay es un control explícito de los pesos; en variantes sencillas corresponde a una penalización adicional, por lo que no debe incluirse toda regularización en la categoría «implicit».