Volver al archivo
#ai#papers#aigen#llm#training

Enmascaramiento de la pérdida

Entrenas a un agente con registros de conversaciones con herramientas. El registro contiene sus órdenes y las respuestas de las herramientas. Quieres evaluarlo por determinados fragmentos, pero permitirle seguir leyendo los demás como contexto para la siguiente acción.

Loss masking determina qué posiciones contribuyen a la pérdida, es decir, a la evaluación numérica del error durante el aprendizaje. Un token —un fragmento de texto— puede seguir siendo visible en la entrada aunque el modelo no sea evaluado directamente por predecirlo.

Al entrenar únicamente con las respuestas del agente, el texto del usuario y el resultado de la herramienta ayudan a elegir el siguiente paso, pero no reciben su propia penalización por la predicción. Por tanto, el modelo no tiene que aprender a generar cada parte del registro completo.

Esto difiere del enmascaramiento causal, que limita el flujo de información entre posiciones. La ausencia de un componente de pérdida para un token no tiene por qué significar que no influya en el entrenamiento: sus cálculos pueden afectar a las posiciones posteriores que sí se evalúan. El trabajo «Don’t Mask the Environment», §2, estudia las consecuencias de elegir qué fragmentos se evalúan.

Véase también: Sequence Packing muestra por qué, al combinar ejemplos, hay que controlar por separado el acceso al contexto y las posiciones evaluadas por la pérdida.

Seis tokens permanecen en una sola fila, pero solo tres de color naranja están conectados al platillo de una balanza que simboliza la pérdida.