Cabeza del modelo de lenguaje
El modelo ha procesado «Hoy bebo» y tiene una descripción interna de ese contenido en forma de una lista de números. Sin embargo, el usuario espera texto. Necesitamos pasar de la descripción oculta del modelo a puntuaciones de candidatos para el siguiente fragmento de la respuesta.
LM head es la capa final del modelo de lenguaje, que calcula una puntuación para cada token del vocabulario. Un token es un fragmento de texto y su puntuación, antes de convertirla en probabilidad, se llama logit.
En un ejemplo simplificado, la descripción de entrada es (2, 1). Un candidato con pesos (1, 0) recibe 2, y uno con pesos (0, 1) recibe 1: multiplicamos los números correspondientes y sumamos los resultados. Softmax convierte las puntuaciones en probabilidades. Solo después una regla de generación elige el token: el mejor puntuado o uno sorteado.
La LM head no comprueba por sí sola la veracidad de la respuesta. Un pequeño cambio en la descripción oculta también puede cambiar al ganador si los candidatos están cerca. El Transformer original, §3.4, describe la proyección de la salida al vocabulario. El artículo sobre cuantización muestra cómo una diferencia de los cálculos anteriores llega a esta etapa.