Zurück zum Archiv
#ai#llm#inference#papers#aigen

Gleitendes Fenster

Das Modell erzeugt eine lange Antwort. Bei jedem weiteren Stück vergleicht es dieses mit dem früheren Text, sodass Arbeits- und Speicheraufwand wachsen. Was wäre, wenn wir ihm nur den letzten Teil des Gesprächs zugänglich machen?

Sliding Window Attention begrenzt den direkten Zugriff einer Position auf ein benachbartes Fenster von Tokens — Textstücken. In einem Modell zur Vorhersage einer Fortsetzung sind das gewöhnlich die aktuelle Position und eine begrenzte Zahl früherer Positionen. Das Fenster verschiebt sich mit den aufeinanderfolgenden Positionen.

Umfasst das Fenster vier Positionen, liest die fünfte nicht direkt die gesamte Historie, sondern nur den erlaubten Endabschnitt. Das verringert die Zahl der Verbindungen in einer einzelnen Schicht. Informationen aus weiter entfernten Stellen können jedoch indirekt über weitere Schichten gelangen; die Fensterbegrenzung bedeutet nicht genau dasselbe wie das Entfernen jeglicher Erinnerung an früheren Text.

In Mistral 7B, §2, werden dieser Mechanismus und ein rotierender Speicher beschrieben. Der Preis der Einsparung ist ein begrenzter Zugriff auf entfernte Inhalte. Eine Variante, die zusätzlich anfängliche Anweisungen behält, hat andere Verbindungen als das reine Schiebefenster; ihren Kontext behandelt der Artikel über Prefix Sliding.

Verbindungen

Prefix Sliding. Das Denken darf lang sein, der Speicher nicht [Polski]