Volver al archivo
#ai#llm#glossary#aigen

Atención de múltiples cabezas

Una sola combinación de información puede mezclar demasiado las distintas relaciones de una frase. Al traducir, pueden ser útiles al mismo tiempo las relaciones entre personas, tiempo y forma gramatical. Queremos permitir al modelo calcular varias maneras distintas de combinar el mismo contexto.

Multi-Head Attention (MHA) realiza varios cálculos de attention, llamados cabezas. Cada uno usa sus propias transformaciones aprendidas de las descripciones query, key y value: listas de números que sirven para establecer correspondencias y transmitir información. Todas pueden trabajar con los mismos tokens, es decir, fragmentos de texto.

En un modelo ilustrativo, tres cabezas devuelven cuatro números cada una. Sus resultados se colocan uno junto a otro en una lista de doce números y después se transforman conjuntamente. No es una simple votación ni la media de tres respuestas.

La estructura permite obtener distintos patrones de mezcla, pero no asigna de antemano papeles como «cabeza de gramática» o «cabeza de tiempo». Hay que comprobar qué ha aprendido realmente una cabeza. Self-attention determina la fuente de datos, mientras que MHA indica el número de conjuntos de cálculos paralelos; ambos conceptos pueden aparecer juntos.

Mecanismo y detalles

En un Transformer, cada cabeza realiza atención por producto escalar escalado. Después se combinan sus resultados por concatenación, es decir, colocando los vectores uno junto a otro, y se transforman con una proyección de salida compartida. No es un simple promedio de los resultados. Descripción de la construcción e implementación: Dive into Deep Learning, §11.5.

Varios conjuntos de pesos para la misma secuencia

En un sistema ilustrativo, la representación tiene 12 coordenadas y tres cabezas devuelven cuatro cada una. La concatenación da 12 coordenadas que la proyección de salida puede seguir mezclando. Cada cabeza calcula sus propios pesos para las posiciones disponibles. No es necesario dividir la frase en tres fragmentos separados: lo que difiere son las proyecciones de las representaciones, no necesariamente los conjuntos de tokens.

El mecanismo permite utilizar en paralelo distintas relaciones, pero no impone papeles como «esta cabeza se ocupa de la gramática». El comportamiento concreto surge del entrenamiento y requiere comprobación.

MHA y autoatención describen características diferentes del cálculo. La primera indica que hay varias cabezas; la segunda, que las consultas, claves y valores proceden de la misma secuencia. Pueden darse juntas. En la arquitectura original también se aplicó MHA entre el codificador y el decodificador. Vaswani et al., §3.2.2–3.2.3.

Véase también: la atención multi-query comparte un conjunto de K/V entre las cabezas de consulta, mientras que la atención de consultas agrupadas comparte K/V dentro de cada grupo.