Sliding window
Model tworzy długą odpowiedź. Przy każdym kolejnym kawałku porównuje go z wcześniejszym tekstem, więc rośnie ilość pracy i pamięci. Co, jeśli pozwolimy mu korzystać tylko z ostatniego fragmentu rozmowy?
Sliding Window Attention ogranicza bezpośredni dostęp danej pozycji do sąsiedniego okna tokenów — kawałków tekstu. W modelu przewidującym kontynuację jest to zwykle bieżąca pozycja i ograniczona liczba wcześniejszych. Okno przesuwa się wraz z kolejnymi pozycjami.
Jeżeli okno obejmuje cztery pozycje, piąta nie odczytuje bezpośrednio całej historii, tylko dozwoloną końcówkę. Zmniejsza to liczbę połączeń w pojedynczej warstwie. Informacja z dalszych miejsc może jednak docierać pośrednio przez kolejne warstwy; ograniczenie okna nie oznacza dokładnie tego samego co usunięcie wszelkiej pamięci wcześniejszego tekstu.
W Mistral 7B, §2, opisano taki mechanizm i pamięć rotacyjną. Ceną oszczędności jest ograniczenie dostępu do odległych treści. Wariant zachowujący dodatkowo początkowe instrukcje ma inne połączenia niż samo przesuwane okno; jego kontekst omawia artykuł o Prefix Sliding.