Volver al archivo
#ai#llm#glossary#aigen

Ajuste fino

El modelo entrenado sabe procesar el lenguaje, pero quieres que clasifique los mensajes de la empresa como «devolución», «entrega» o «pago». La habilidad general todavía no proporciona la forma de trabajar que esperas. Preparas ejemplos de mensajes con las categorías correctas.

Fine-tuning es el entrenamiento adicional de un modelo existente o de sus parámetros de adaptación con datos nuevos. Cambia los números que controlan su funcionamiento, de modo que la adaptación puede mantenerse también en consultas posteriores.

En el ejemplo, el modelo compara sus predicciones con las categorías dadas y el entrenamiento modifica los parámetros. Pegar unos ejemplos en un único prompt, es decir, el texto de entrada, es otra operación: por sí sola no cambia los pesos.

Se pueden entrenar todos los pesos o solo pequeños componentes añadidos, como LoRA. Fine-tuning no garantiza una mejora en todas las tareas; los datos deficientes pueden consolidar errores y adaptarse a un ámbito puede modificar otros comportamientos. El punto de partida suele proceder de Pre-training.

Véase también: Catastrophic Forgetting [Polski] —el deterioro considerable de habilidades aprendidas anteriormente durante el entrenamiento adicional—.

Mecanismo y detalles

En el GPT original, al entrenamiento con texto le seguía un entrenamiento con ejemplos etiquetados para tareas concretas. Se optimizaban los parámetros del modelo y de la capa de salida añadida. Esta división se describe en Improving Language Understanding by Generative Pre-Training, §3.2.

Qué cambia realmente

En el ajuste fino completo se actualizan todos los parámetros del modelo incluidos en el entrenamiento. También se pueden entrenar solo determinados parámetros o pequeños módulos de adaptación. Por ejemplo, LoRA mantiene congelados los pesos base y entrena matrices que describen su cambio; Hu et al., §2 y §4.1 ofrecen los detalles. Por tanto, congelar los pesos base no excluye el aprendizaje: hay que comprobar si se están optimizando otros parámetros.

Ejemplo propio: un conjunto contiene mensajes de clientes y las categorías correctas «devolución», «entrega» y «pago». El entrenamiento puede adaptar un modelo existente a esta clasificación. Pegar algunos de esos ejemplos en un prompt normal cambia su entrada, pero por sí solo no actualiza los parámetros. Brown et al., Language Models are Few-Shot Learners, §2 describen la diferencia entre la adaptación en contexto y el ajuste fino.

El ajuste fino supervisado utiliza ejemplos de respuestas deseadas o etiquetas. El nombre «ajuste fino», sin más precisión, no indica una función objetivo concreta ni el número de parámetros entrenados. El SFT con consistencia de orden existente es una forma particular de entrenar un modelo de puntuación, y no una definición general de esta etapa.

Véase también: Sequence Packing —la colocación de varios ejemplos de texto en una única entrada de entrenamiento para reducir el relleno—.