Ventana deslizante
El modelo crea una respuesta larga. En cada fragmento siguiente lo compara con el texto anterior, por lo que aumentan el trabajo y la memoria. ¿Qué ocurre si le permitimos usar solo el último tramo de la conversación?
Sliding Window Attention limita el acceso directo de una posición a una ventana vecina de tokens —fragmentos de texto—. En un modelo que predice continuaciones, suele incluir la posición actual y un número limitado de anteriores. La ventana se desplaza con las posiciones sucesivas.
Si la ventana abarca cuatro posiciones, la quinta no lee directamente todo el historial, sino solo el tramo final permitido. Esto reduce el número de conexiones en una capa. Sin embargo, la información de lugares más lejanos puede llegar indirectamente a través de las capas sucesivas; limitar la ventana no equivale exactamente a eliminar toda memoria del texto anterior.
Mistral 7B, §2, describe este mecanismo y una memoria circular. El precio del ahorro es limitar el acceso al contenido lejano. Una variante que conserve además las instrucciones iniciales tiene conexiones distintas a las de una ventana deslizante sola; el artículo sobre Prefix Sliding explica ese contexto.
Relaciones
Prefix Sliding. El razonamiento puede ser largo; la memoria no [Polski]