Volver al archivo
#ai#papers#aigen#llm#training

SFT con consistencia de orden

Muestras al modelo los mismos documentos en dos órdenes. La puntuación de uno cambia de 0,70 a 0,60. Si después rechazas documentos por debajo de un umbral, barajarlos puede cambiar la respuesta del sistema. Quieres limitar esa inestabilidad durante el entrenamiento.

Order-consistency SFT es una forma de entrenamiento adicional de un modelo evaluador que favorece puntuaciones coherentes del mismo candidato con distintos órdenes. SFT significa supervised fine-tuning: adaptar el modelo con ejemplos que tienen resultados dados.

En nuestro ejemplo, la media de las dos puntuaciones es 0,65. Una penalización adicional considera las desviaciones de ambos resultados respecto a esa media y favorece que se acerquen. Al mismo tiempo, hace falta evaluar respecto a una etiqueta razonable: un modelo que siempre devolviera 0,65 sería coherente, pero no distinguiría los buenos documentos de los malos.

Los autores, §3, combinan esos dos objetivos de entrenamiento. Los cambios de orden se usan durante el aprendizaje; no hace falta repetirlos en cada consulta posterior. El método reduce la influencia del orden, pero no garantiza su desaparición completa ni la corrección de las puntuaciones fuera del ámbito comprobado.