Autodestilación on-policy
Quieres mejorar el modelo, pero no tienes un profesor independiente más fuerte. Sin embargo, el mismo modelo puede recibir una pista adicional, como la respuesta en el texto de la tarea. ¿Puede su versión mejor informada enseñar a la versión sin esa pista?
On-policy self-distillation utiliza precisamente esa relación. El estudiante crea muestras de acuerdo con su forma actual de responder, de ahí «on-policy». El profesor procede del mismo modelo, de ahí «self», y evalúa sus siguientes tokens, es decir, fragmentos de texto. El estudiante aprende de esas evaluaciones en lugar de limitarse a copiar un documento preparado.
En la variante descrita en TTPO, §2.2 y §3.3, el profesor recibe la respuesta como contexto adicional. Se comparan las predicciones de los siguientes tokens sobre el texto producido por el estudiante. Es una forma particular de Knowledge Distillation.
El contexto adicional puede mejorar la señal, pero una pista incorrecta puede distorsionarla. El método no demuestra que el modelo haya creado una nueva verdad sin fuente. Importa de dónde proceden las muestras, qué ventaja tiene el profesor y cuáles de sus predicciones utilizamos realmente.