Volver al archivo
#ai#llm#glossary#aigen

Normalización por capa

A la siguiente capa llega la descripción de un fragmento con los números [2, 4] y la de otro con [20, 40]. La magnitud de la señal puede variar mucho. Quieres facilitar los cálculos convirtiendo los números de cada descripción a una escala comparable.

Layer Normalization normaliza un vector —una lista de números— a partir de su propia media y dispersión. En un Transformer típico, lo hace por separado para cada posición del texto. No necesita otras frases del mismo grupo de datos.

Para [2, 4], la media es 3. Al restarla queda [-1, 1]; dividir por una medida adecuada de dispersión regula la escala. Después, unos coeficientes aprendidos pueden estirar y desplazar cada número.

Por tanto, el resultado final no tiene por qué tener exactamente media cero y varianza uno. Es una operación local que estabiliza el procesamiento, no la eliminación de diferencias de significado entre tokens ni una garantía de estabilidad de toda la red. RMSNorm regula la escala sin restar la media.

Mecanismo y detalles

El trabajo de Ba, Kiros y Hinton, Layer Normalization, §3 introduce esta distinción. Las estadísticas dependen de la entrada actual, por lo que la normalización no necesita otros ejemplos del mismo lote.

Para una coordenada xix_i, la expresión con escalado y desplazamiento aprendidos es:

yi=γixi−μσ2+ε+βi.y_i=\gamma_i\frac{x_i-\mu}{\sqrt{\sigma^2+\varepsilon}}+\beta_i.

μ\mu es la media del vector y σ2\sigma^2 la media de los cuadrados de las desviaciones respecto a ella. Un ε\varepsilon positivo protege contra la división por cero. Los parámetros γi\gamma_i y βi\beta_i se aprenden. La documentación de Keras presenta el cálculo completo y el significado del eje de normalización.

Ejemplo con dos coordenadas

Para [2; 4], la media es 3 y la varianza, 1. Al restar la media obtenemos [−1; 1]. Con un epsilon muy pequeño, gamma igual a uno y beta igual a cero, el resultado estará cerca de [−1; 1].

Después de aprender gamma y beta, el vector final no tiene por qué tener media cero ni varianza uno. La normalización tampoco significa que todo el modelo sea independiente de la escala de todos sus parámetros.

En el Transformer original, LayerNorm se aplicaba después de la suma mediante la conexión residual, tanto en la atención como en la FFN. Attention Is All You Need, §3.1 muestra este orden; no debe convertirse en una regla para todos los LLM.