Volver al archivo
#ai#llm#glossary#aigen

Preentrenamiento

Quieres que el modelo reconozca relaciones en el lenguaje antes de adaptarlo a un trabajo concreto, como clasificar mensajes de clientes. Preparar manualmente respuestas para todo el texto sería inviable. Sin embargo, el propio texto permite crear tareas de aprendizaje.

Pre-training es la etapa en la que se forman los parámetros que sirven como punto de partida para el uso posterior o la adaptación del modelo. Los parámetros son números que controlan sus cálculos. En los modelos de lenguaje, la señal suele proceder de un gran conjunto de textos.

A partir de la frase «Ana tiene un gato», se puede crear una tarea de predecir el siguiente fragmento después de «Ana tiene un» o reconstruir la palabra oculta en «Ana [MASK] un gato». Ambos ejercicios usan el texto existente, aunque entrenan con un acceso distinto al contexto.

El nombre de la etapa no impone una única tarea ni arquitectura. Después del pre-training, el modelo no tiene por qué seguir bien las instrucciones del usuario. Fine-tuning puede adaptarlo después a ejemplos y comportamientos seleccionados.

Mecanismo y detalles

El nombre indica el papel de esta etapa en el proceso de aprendizaje. No impone una arquitectura ni una función objetivo concretas.

La misma etapa, distintas tareas

En el GPT original, el modelo aprende a predecir el siguiente token a partir de los anteriores. Eso es Autoregressive Language Modeling. Los autores describen esta etapa antes de la adaptación a tareas con etiquetas en Improving Language Understanding by Generative Pre-Training, §3.1–3.2.

El BERT original utiliza otro conjunto de objetivos: reconstruye determinados tokens después de perturbar la entrada y reconoce si dos fragmentos aparecían consecutivamente en el corpus. Al reconstruir un token puede utilizar el contexto de ambos lados. Son tareas concretas del artículo de BERT, §3.1, no un conjunto obligatorio para todos los modelos.

Ejemplo propio de la diferencia: a partir de la secuencia A B C se puede preparar una tarea que prediga C después de A B, o una que reconstruya B desde A [MASK] C. Ambas señales proceden del texto disponible, pero requieren flujos de información diferentes. La ausencia de una etiqueta asignada manualmente no significa que no haya un objetivo de entrenamiento.

Qué queda después del entrenamiento

El modelo guardado conserva los parámetros aprendidos. Entre ellos se encuentra la tabla de embeddings de tokens, que en GPT se entrena junto con el resto de la red. La siguiente etapa, el ajuste fino, parte de esos parámetros ya aprendidos y adapta el modelo a una aplicación concreta.

La palabra «preentrenado» por sí sola no dice con qué datos se entrenó el modelo, qué optimizó ni lo bien que realizará una tarea concreta. Esa información debe consultarse en la descripción de cada modelo.