Volver al archivo
#ai#llm#inference#papers#aigen

Sumidero de atención

Imagina un modelo que lee una conversación durante muchas horas. Para limitar la memoria, le dejamos solo los últimos fragmentos. En algunos modelos, eliminar unos fragmentos iniciales de texto puede empeorar su funcionamiento aunque su contenido no parezca importante. ¿Por qué?

Attention sink es una posición que recibe gran parte de los pesos del mecanismo attention pese a que su contenido tiene poca importancia. Attention mezcla información de los fragmentos de texto disponibles; sus pesos determinan la contribución de cada fragmento y suman uno gracias a Softmax. Parte del peso puede dirigirse al principio de la secuencia como un lugar fijo donde depositar el exceso.

En StreamingLLM, §3–4, conservar unas posiciones iniciales junto con los últimos tokens, es decir, unidades de texto, estabiliza los modelos estudiados durante generaciones largas. Eso no significa que los primeros cuatro tokens de todo modelo siempre desempeñen ese papel.

Una distinción importante: un peso grande en attention no demuestra que un fragmento sea el más importante semánticamente. Conservar las instrucciones al principio de la conversación también puede ser necesario por su contenido. Por eso, un conjunto de instrucciones fijadas y un attention sink no son el mismo concepto.

Relaciones

Prefix Sliding. El razonamiento puede ser largo; la memoria no [Polski]