Back to archive
#ai#llm#glossary#aigen

Multi-Head Attention

Multi-Head Attention (MHA) łączy wyniki kilku obliczeń attention wykonywanych na różnych uczonych projekcjach query, key i value. Każdy taki zestaw projekcji i odpowiadające mu obliczenie tworzą attention head.

W Transformer poszczególne heads wykonują Scaled Dot-Product Attention. Ich wyniki są następnie łączone przez konkatenację, czyli zestawienie wektorów obok siebie, i przekształcane wspólną projekcją wyjściową. Nie jest to zwykłe uśrednianie wyników. Opis konstrukcji i implementacja: Dive into Deep Learning, §11.5.

Kilka zestawów wag dla tej samej sekwencji

W ilustracyjnym układzie reprezentacja ma 12 współrzędnych, a trzy heads zwracają po cztery. Konkatenacja daje 12 współrzędnych, które projekcja wyjściowa może dalej mieszać. Każda head oblicza własne wagi dla dostępnych pozycji. Nie trzeba dzielić zdania na trzy rozłączne fragmenty: różnią się projekcje reprezentacji, a nie obowiązkowo zbiory tokenów.

Mechanizm umożliwia równoległe wykorzystywanie różnych relacji, ale nie narzuca ról typu „ta head odpowiada za gramatykę”. Konkretne zachowanie wynika z uczenia i wymaga sprawdzenia.

MHA i Self-attention opisują różne cechy obliczenia. Pierwsze mówi o wielu heads, drugie o pochodzeniu query, key i value z tej samej sekwencji. Mogą występować razem. W oryginalnej architekturze MHA zastosowano również między encoderem a decoderem. Vaswani et al., §3.2.2–3.2.3.

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.