Back to archive
#ai#llm#inference#papers#aigen

Attention sink

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.

Attention sink to pierwsze tokeny sekwencji, które zbierają resztę masy softmaxu. Softmax musi się sumować do 1. Jak nic w kontekście nie zasługuje na uwagę, waga spływa na początek — często na pierwsze 4 tokeny. StreamingLLM (Xiao et al.) zostawia właśnie te kilka tokenów plus okno recency, żeby model nie rozjechał się przy długim streamingu.

W Prefix Sliding prefix jest dłuższym sinkiem, nie czterema tokenami. System, zadanie, narzędzia, znacznik myślenia. To nie tylko stabilizacja softmaxu. To instrukcja, której model nie może zgubić, nawet jak wyrzuci środek łańcucha.

42au⁝ Prefix Sliding. Myślenie może być długie, pamięć nie