Volver al archivo

µP y transferencia de hiperparámetros

µP y transferencia de hiperparámetros

Encontrar un buen paso de aprendizaje requiere pruebas. Para un modelo enorme, cada prueba es cara. ¿Se pueden encontrar buenos ajustes en una red pequeña y usarlos después de aumentar su anchura, es decir, el número de elementos de sus capas?

Maximal Update Parametrization (µP) es una forma de escalar los parámetros y sus actualizaciones al cambiar la anchura de la red. Busca mantener un carácter comparable del aprendizaje, de modo que parte de los hiperparámetros —ajustes elegidos antes del entrenamiento— pueda transferirse desde modelos pequeños.

En la práctica, primero preparamos un modelo pequeño según µP, probamos varios tamaños del paso de aprendizaje y después ampliamos el modelo conservando las reglas de escalado adecuadas. Es más que copiar una cifra a cualquier red mayor: también importan la inicialización y la parametrización de cada capa.

Yang y colaboradores, §2–3, describen la transferencia de ajustes y las pruebas del método. El ahorro consiste en un ajuste más barato, pero la transferencia tiene un alcance determinado. Cambiar los datos, la arquitectura, la profundidad o la regla de aprendizaje puede requerir una comprobación aparte. Véase también el trabajo posterior citado en la nota original.

Relaciones

¿Podemos construir una teoría física del proceso de aprendizaje que prediga el comportamiento macroscópico de las redes? [Polski]