Volver al archivo
#ai#llm#glossary#aigen

Perplejidad

Comparas dos modelos sobre el mismo texto. Quieres saber cuál predice mejor sus fragmentos sucesivos, no solo cuál acertó más ganadores individuales. Necesitas una cifra que resuma las probabilidades asignadas a la secuencia real.

Perplexity (PPL) resume lo bien que un modelo predice los siguientes tokens, es decir, los fragmentos del texto evaluado. Cuanto menores sean las probabilidades que asigna a los fragmentos que realmente aparecen, mayor será el resultado. Un resultado menor significa una mejor predicción de ese texto. La fórmula de abajo, después del ejemplo, muestra el cálculo exacto.

Si cada token correcto tiene una probabilidad de 1/4, la PPL es 4; con una probabilidad de 1/2, es 2. Puede servir como intuición de la incertidumbre efectiva, pero no como el número literal de palabras consideradas en cada paso.

La comparación exige datos, división en tokens y acceso al contexto compatibles. La PPL no mide directamente la veracidad ni la utilidad de las respuestas. El experimento «Pingüino en la nevera» muestra cómo un token muy inesperado afecta al resultado de todo el texto.

Mecanismo y detalles

PPL=exp⁡(−1N∑t=1Nln⁡p(xt∣x<t))\mathrm{PPL}=\exp\left(-\frac{1}{N}\sum_{t=1}^{N}\ln p(x_t\mid x_{<t})\right)

NN es el número de tokens evaluados y x<tx_{<t} su contexto anterior. Con el logaritmo natural, esto es exp⁡(H)\exp(H), donde HH representa la entropía cruzada media para los tokens correctos individuales, sin términos adicionales de pérdida. De forma equivalente, puede calcularse la media geométrica de los inversos de esas probabilidades. Bengio et al., §2 presentan esta definición.

Cómo interpretar el resultado

Ejemplo propio: el modelo asigna a cada token evaluado una probabilidad de 0,25. La PPL es entonces 4. Si cada una de esas probabilidades aumenta hasta 0,5, la PPL baja a 2. Esto no significa que el modelo elija siempre entre exactamente cuatro o dos tokens; el resultado resume todo el texto evaluado.

Un pingüino en la nevera

Abres la nevera. Dentro hay un pingüino. Para ti es un problema logístico; para el modelo de lenguaje, el último token de la frase. ¿Bastarán nueve predicciones muy buenas para cubrir el coste de una sorpresa así?

Es un experimento mental propio: dos modelos inventados, probabilidades asignadas manualmente y diez tokens convencionales. Cada modelo evalúa el mismo texto, token por token, conociendo los tokens anteriores de ese texto. Solo mostramos la probabilidad del token que realmente apareció; la masa restante corresponde a otras posibilidades. No son mediciones de un LLM concreto.

El experimento interactivo requiere JavaScript. A continuación encontrarás un ejemplo con el cálculo del resultado.

En la configuración inicial, el modelo A asigna un 90% a cada uno de los nueve primeros tokens y un 0,01% al último. El modelo B asigna un 50% a cada token. La media aritmética de las probabilidades es aproximadamente un 81% para A y un 50% para B, pero B gana en PPL: 2 frente a aproximadamente 2,762 de A.

¿A qué se debe este cambio? Si expresamos el coste como −log⁡2p-\log_2 p, los nueve primeros tokens cuestan al modelo A unos 1,368 bits en total. Solo «pingwina.» cuesta unos 13,288 bits. Al dividir la suma por diez obtenemos 1,466 bits por token, es decir, PPL≈2,762\mathrm{PPL}\approx 2{,}762. El modelo B paga un bit por token. Una gran sorpresa aumenta mucho la pérdida logarítmica media, aunque los demás tokens tuvieran probabilidades altas. Prueba a subir la probabilidad de «pingwina» al 1%: A vuelve a ganar.

Qué se puede comparar

La comparación requiere los mismos datos y reglas de cálculo compatibles, incluida la tokenización, por ejemplo la codificación por pares de bytes. El contexto disponible también importa. Dividir el texto en fragmentos separados priva al modelo de los tokens anteriores al comienzo de cada fragmento y puede empeorar el resultado. La documentación de Hugging Face describe la evaluación con una ventana deslizante y explica por qué la PPL habitual no se aplica directamente a BERT.

Una PPL menor indica una mejor predicción del texto evaluado bajo ese procedimiento, pero no garantiza una respuesta mejor en una tarea concreta. En Attention Is All You Need, §5.4, el label smoothing empeoraba la PPL y, al mismo tiempo, mejoraba la exactitud y BLEU.