Zurück zum Archiv
#ai#llm#inference#papers#aigen

Attention Sink

Stell dir ein Modell vor, das stundenlang ein Gespräch liest. Um den Speicher zu begrenzen, lassen wir ihm nur die letzten Fragmente. Bei manchen Modellen kann das Entfernen einiger anfänglicher Textstücke das Verhalten verschlechtern, selbst wenn ihr Inhalt unwichtig erscheint. Warum?

Ein Attention Sink ist eine Position, die trotz geringer Bedeutung ihres Inhalts einen großen Teil der Attention-Gewichte erhält. Attention mischt Informationen aus verfügbaren Textstücken; ihre Gewichte bestimmen den Anteil jedes Stücks und summieren sich dank Softmax zu eins. Ein Teil des Gewichts kann auf den Sequenzanfang fallen wie auf einen festen Ablageplatz für Überschüsse.

In StreamingLLM, §3–4 stabilisiert das Behalten einiger anfänglicher Positionen neben den letzten Tokens, also Texteinheiten, die untersuchten Modelle bei langer Generierung. Das bedeutet nicht, dass die ersten vier Tokens jedes Modells immer diese Rolle haben.

Eine wichtige Unterscheidung: Ein großes Attention-Gewicht beweist nicht, dass ein Fragment semantisch am wichtigsten ist. Anweisungen am Gesprächsanfang zu behalten kann auch wegen ihres Inhalts nötig sein. Ein angehefteter Anweisungssatz und ein Attention Sink sind deshalb nicht derselbe Begriff.

Verbindungen

Prefix Sliding. Das Denken darf lang sein, der Speicher nicht [Polski]