Back to archive
#ai#llm#inference#papers#aigen

Attention sink

Wyobraź sobie model czytający rozmowę przez wiele godzin. Żeby ograniczyć pamięć, zostawiamy mu tylko ostatnie fragmenty. W niektórych modelach wyrzucenie kilku początkowych kawałków tekstu potrafi pogorszyć działanie, nawet gdy ich treść nie wydaje się ważna. Dlaczego?

Attention sink to pozycja, która otrzymuje dużą część wag mechanizmu attention mimo niewielkiego znaczenia jej treści. Attention miesza informacje z dostępnych kawałków tekstu; jego wagi określają udział każdego kawałka i sumują się do jedności dzięki Softmax. Część wagi może trafiać na początek sekwencji jak na stałe miejsce odkładania nadmiaru.

W StreamingLLM, §3–4 zachowanie kilku początkowych pozycji obok ostatnich tokenów, czyli jednostek tekstu, stabilizuje badane modele podczas długiego generowania. Nie oznacza to, że pierwsze cztery tokeny każdego modelu zawsze mają tę rolę.

Ważne rozróżnienie: duża waga attention nie dowodzi, że dany fragment jest semantycznie najważniejszy. Zachowywanie instrukcji na początku rozmowy może być potrzebne również ze względu na ich treść. Dlatego przypięty zestaw instrukcji i attention sink nie są tym samym pojęciem.

Powiązania

42au⁝ Prefix Sliding. Myślenie może być długie, pamięć nie