RMSNorm
Una capa recibe una lista de números de gran magnitud y otra valores mucho menores. Estas diferencias de escala pueden dificultar los cálculos y el entrenamiento. Quieres uniformar el tamaño general de la señal conservando las proporciones entre sus elementos.
RMSNorm divide una lista de números por su RMS, la raíz cuadrada de la media de sus cuadrados. Después puede multiplicar cada coordenada por un coeficiente aprendido distinto. La lista de números es un vector; en el modelo describe el fragmento de texto que se procesa.
Para [3, 4], el RMS es aproximadamente 3,54. Tras dividir obtenemos aproximadamente [0,85, 1,13]: la escala común se ha reducido y la proporción sigue igual. Las implementaciones añaden una constante pequeña para evitar dividir por cero. Zhang y Sennrich, §3, describen este mecanismo.
A diferencia de Layer Normalization, RMSNorm no resta la media de los números de entrada. Normalizar una sola rama no elimina la escala de todos los cálculos del modelo, especialmente de la ruta de Residual connection, que transmite la entrada. Es una operación local, no una garantía de invariancia de toda la red.
Relaciones
La tasa de aprendizaje no basta. Lo que cuenta es ELR [Polski]