Modelado autorregresivo del lenguaje
Empiezas la frase «Hoy bebo…». Después de añadir «té», las posibles continuaciones son distintas que después de «agua». El modelo tiene que considerar el texto ya elegido en cada paso siguiente, en lugar de adivinar todos los lugares de forma independiente.
Autoregressive Language Modeling describe el texto mediante las probabilidades de los sucesivos tokens, es decir, fragmentos de texto, que dependen de los tokens anteriores. El modelo calcula las probabilidades de las posibles continuaciones y una regla aparte elige qué añadir.
Tras elegir «té», ese fragmento entra en el contexto del siguiente paso. La probabilidad de la secuencia completa se obtiene combinando las probabilidades de las sucesivas elecciones. Durante el entrenamiento, el texto es conocido, por lo que se pueden evaluar las predicciones respecto a los fragmentos siguientes reales.
«Autoregressive» define una forma de modelar, no el nombre de una única arquitectura. Tampoco significa que la continuación más probable sea verdadera. Causal Masking permite entrenar muchas posiciones a la vez sin ver sus respuestas futuras.
Mecanismo y detalles
Para una secuencia de longitud fija se expresa así:
representa el token en la posición , el prefijo anterior y los parámetros del modelo. El primer factor no tiene tokens anteriores del texto; la implementación puede utilizar un marcador de inicio. Un modelo con una ventana de contexto limitada utiliza solo la parte final disponible del prefijo. Bengio et al., A Neural Probabilistic Language Model, §1.2 y §2 describen esta distribución y un modelo neuronal que predice la siguiente palabra.
Entrenamiento y generación
Ejemplo propio: después del texto «Hoy bebo», el modelo asigna probabilidades a las posibles continuaciones. Cuando el procedimiento de generación elige el token correspondiente a «té», este pasa a formar parte del prefijo del siguiente paso. La propia distribución no determina si hay que elegir la probabilidad más alta o muestrear.
Durante el entrenamiento se conoce la secuencia correcta. El optimizador aumenta la probabilidad logarítmica de sus tokens sucesivos. El GPT original, §3.1, aplica este objetivo a los tokens del texto usando un decoder Transformer.
El enmascaramiento causal, junto con el desplazamiento de los objetivos, permite calcular predicciones para muchas posiciones en paralelo sin revelar las respuestas. Vaswani et al., §3.1 lo describen para el decodificador. La dependencia de los tokens generados respecto a las elecciones anteriores sigue siendo secuencial.
Es una forma de modelar la distribución, no el nombre de una arquitectura: ya existía antes del Transformer. En un modelo típico de generación de texto, la cabeza del modelo de lenguaje proporciona los logits, a partir de los cuales Softmax calcula la distribución del siguiente token.