Entropía cruzada
Dos modelos señalan la misma palabra como la mejor continuación, pero el primero le da un 80% de probabilidad y el segundo solo un 20%. Comprobar únicamente el ganador omite esa diferencia. Al entrenar necesitamos una medida que indique con qué fuerza respalda el modelo el resultado correcto.
Cross-entropy mide el ajuste de las probabilidades predichas al resultado objetivo. Si hay un único token correcto —un fragmento de texto de los datos—, la penalización es el logaritmo negativo de la probabilidad que se le asigna. El logaritmo hace que una probabilidad muy baja de la respuesta correcta implique una gran penalización.
Para 0,8, la penalización es aproximadamente 0,223, y para 0,2, aproximadamente 1,609, usando logaritmos naturales. Por tanto, el entrenamiento puede aumentar la confianza de las predicciones correctas incluso cuando el ganador ya es correcto.
Softmax calcula las probabilidades; Cross-entropy las evalúa frente al objetivo. Un error pequeño en los datos no demuestra que el modelo diga la verdad en cualquier conversación. El experimento siguiente muestra cómo la probabilidad asignada afecta a la penalización.
Mecanismo y detalles
representa la probabilidad objetivo del candidato , y la probabilidad predicha. Cuando la etiqueta indica un único token correcto , toda la fórmula se simplifica a . Softmax puede obtener la distribución a partir de los logits; la entropía cruzada la evalúa respecto al objetivo. La documentación de PyTorch: CrossEntropyLoss describe ambos tipos de etiquetas. Esta función concreta recibe directamente los logits, por lo que no deben pasarse previamente por Softmax.
Qué significa el valor de la pérdida
Ejemplo propio: el modelo asigna al token correcto una probabilidad de 0,8. La pérdida es aproximadamente 0,223. Con una probabilidad de 0,2 aumenta hasta aproximadamente 1,609. Utilizamos el logaritmo natural. Dos modelos pueden señalar el mismo token como el más probable y, aun así, obtener pérdidas distintas, porque también importa el valor de la probabilidad que le asignan.
En el modelado autorregresivo del lenguaje, el objetivo es el siguiente token del texto. Minimizar la media de esta pérdida equivale a maximizar la log-verosimilitud de los datos, sin tener en cuenta términos adicionales de regularización. Bengio et al., A Neural Probabilistic Language Model, §2 describen esta forma del objetivo.
La media debe corresponder a las posiciones pertinentes: el padding y los tokens excluidos de la evaluación no deben modificarla. Con etiquetas objetivo suaves no se puede sustituir la suma completa por un único . La perplejidad está relacionada con la pérdida media de los tokens individuales.