Experience Replay
Un modelo ha aprendido a dirigir las preguntas de los clientes a «entrega» y «devoluciones». Ahora lo entrenas para reconocer reclamaciones, como «El producto llegó dañado». Si los siguientes ejercicios contienen solo reclamaciones, puede empeorar al atender el conocido «¿Dónde está mi paquete?». El archivo antiguo completo no está disponible. ¿Podría volver al menos a unos pocos mensajes guardados?
Experience Replay (ER) consiste en almacenar parte de los ejemplos anteriores y reutilizarlos para el entrenamiento. En una versión sencilla, mezclamos ejemplos de la memoria con un lote de datos nuevos. Esta memoria se llama replay buffer: un contenedor de datos para repasar, no un registro de todo lo que sabe el modelo. Este entrenamiento conjunto se describe en Chaudhry et al., Continual Learning with Tiny Episodic Memories, §2, algoritmo 1.

Qué entra en el siguiente ejercicio
Antes de perder el archivo, guardamos cuatro mensajes junto con sus departamentos correctos. Ahora tenemos cuatro reclamaciones nuevas. Sin repaso, el modelo aprende de cuatro mensajes nuevos. Con repaso, practica también con cuatro antiguos: vuelve a recibir la señal de que «¿Dónde está mi paquete?» corresponde a entrega. En este pequeño ejemplo usamos todo el búfer; los búferes mayores suelen aportar un lote obtenido por muestreo.
Sin embargo, no basta con contar los espacios de memoria. Cuatro preguntas guardadas sobre entrega no contienen ningún ejemplo de devolución. Al sustituir dos por «¿Cómo envío de vuelta mi compra?» y «Quiero devolver una camiseta», la cantidad de ejemplos repetidos no cambia, pero abarca ambos departamentos anteriores. El siguiente experimento cuenta ejemplos en un lote de datos; no predice la exactitud del modelo.
El repaso solo ayuda con los datos disponibles
El modelo recibe una oportunidad de practicar respuestas anteriores, no una garantía de conservar todas sus habilidades. Una muestra aleatoria pequeña puede omitir por completo una categoría poco frecuente; los investigadores observaron este problema con búferes muy pequeños (§4.4 del mismo trabajo). Nuestros mensajes son un ejemplo propio, no un resultado de esos experimentos. El efecto del entrenamiento debe comprobarse con mensajes antiguos y nuevos separados, que no se hayan usado para entrenar. El búfer también ocupa memoria y exige conservar los datos elegidos.
En los juegos, en Reinforcement Learning — aprender acciones a partir de recompensas — se guardan una situación, una acción, una recompensa y la siguiente situación. Muestrear estos registros reduce la dependencia de sucesos que ocurren inmediatamente uno tras otro (Mnih et al., Human-level control through deep reinforcement learning, Methods, «Training algorithm for deep Q-networks»). Son datos distintos de un mensaje con su departamento correcto; los resultados de Atari no deben trasladarse directamente a los LLM.
- Continual Learning establece el objetivo de seguir aprendiendo conservando las capacidades anteriores; ER es una forma de perseguirlo.
- Catastrophic Forgetting [Polski] describe un deterioro considerable de habilidades anteriores, que el repaso puede reducir.
- Fine-tuning es el entrenamiento posterior de un modelo; replay cambia la selección de sus datos. Pegar mensajes antiguos en una conversación no es este tipo de actualización del modelo.
El texto y la ilustración se prepararon con ayuda de IA. Los mensajes y la demostración son un ejemplo educativo propio y simplificado; la ilustración es una metáfora, no un esquema de la arquitectura del modelo.