Back to archive
#ai#llm#inference#papers#aigen

Sliding window

Model tworzy długą odpowiedź. Przy każdym kolejnym kawałku porównuje go z wcześniejszym tekstem, więc rośnie ilość pracy i pamięci. Co, jeśli pozwolimy mu korzystać tylko z ostatniego fragmentu rozmowy?

Sliding Window Attention ogranicza bezpośredni dostęp danej pozycji do sąsiedniego okna tokenów — kawałków tekstu. W modelu przewidującym kontynuację jest to zwykle bieżąca pozycja i ograniczona liczba wcześniejszych. Okno przesuwa się wraz z kolejnymi pozycjami.

Jeżeli okno obejmuje cztery pozycje, piąta nie odczytuje bezpośrednio całej historii, tylko dozwoloną końcówkę. Zmniejsza to liczbę połączeń w pojedynczej warstwie. Informacja z dalszych miejsc może jednak docierać pośrednio przez kolejne warstwy; ograniczenie okna nie oznacza dokładnie tego samego co usunięcie wszelkiej pamięci wcześniejszego tekstu.

W Mistral 7B, §2, opisano taki mechanizm i pamięć rotacyjną. Ceną oszczędności jest ograniczenie dostępu do odległych treści. Wariant zachowujący dodatkowo początkowe instrukcje ma inne połączenia niż samo przesuwane okno; jego kontekst omawia artykuł o Prefix Sliding.

Powiązania

42au⁝ Prefix Sliding. Myślenie może być długie, pamięć nie