Volver al archivo
#ai#llm#glossary#aigen

Destilación de conocimiento

Un modelo grande realiza bien la tarea, pero resulta demasiado costoso para el uso cotidiano. Un modelo pequeño podría intentar reproducir su comportamiento. Sin embargo, necesita ejemplos o evaluaciones que muestren algo más que una lista de etiquetas correctas.

Knowledge Distillation consiste en entrenar un modelo estudiante usando las salidas o predicciones de un modelo profesor. El estudiante cambia realmente sus parámetros; enviar una consulta al profesor no es entrenamiento.

Si el profesor asigna a A una probabilidad de 0,60, a B de 0,35 y a C de 0,05, la etiqueta «A» omite que B es una alternativa cercana. El estudiante puede aprender a reproducir toda esa distribución. Otra variante utiliza textos completos generados por el profesor.

El profesor no tiene por qué ser un único modelo mayor, pero tradicionalmente actúa como fuente del comportamiento que se imita. La destilación también puede transmitir errores. KL Divergence ayuda a medir la concordancia de las predicciones, y On-policy self-distillation es una construcción más específica de los datos y el profesor.

Mecanismo y detalles

En Distilling the Knowledge in a Neural Network, §2, Hinton, Vinyals y Dean describen el aprendizaje con distribuciones suaves de probabilidad. Una temperatura mayor revela más información sobre las relaciones entre los candidatos. Al comparar las distribuciones se utiliza el mismo parámetro tanto en el profesor como en el estudiante. Los autores combinan este objetivo con el aprendizaje a partir de etiquetas correctas cuando están disponibles.

Más información que una sola respuesta

Nuestro ejemplo: el profesor asigna a los tokens hipotéticos A, B y C probabilidades de 0,60; 0,35; 0,05. La etiqueta «A» solo identifica al ganador. La distribución completa indica además que B era mucho más probable que C. El estudiante puede intentar reproducir esas proporciones mediante Cross-entropy o una KL Divergence dirigida de forma adecuada. Es una señal de entrenamiento adicional, no una prueba de que las etiquetas del profesor sean correctas.

En los modelos que generan texto hay que distinguir entre comparar distribuciones del siguiente token y entrenar con secuencias completas generadas. Kim y Rush, Sequence-Level Knowledge Distillation, §2.2–3.2 describen ambos enfoques para la traducción automática. En la variante de secuencia, el estudiante se entrena con las salidas encontradas por la búsqueda en haz del profesor. El texto de esa respuesta no contiene las probabilidades completas de todos los tokens alternativos.

El resultado depende del profesor, de los datos y de las capacidades del estudiante. No supone copiar todas sus habilidades ni garantiza una mejora en todas las tareas. La nota separada sobre autodestilación on-policy describe una variante particular de TTPO; sus condiciones no son la definición general de la destilación de conocimiento.