nDCG@10
El buscador devuelve diez resultados. Los buenos documentos pueden estar en la lista, pero si el más útil ocupa el décimo lugar, quizá el lector no llegue a él. Necesitas una evaluación que considere tanto la relevancia como la posición.
nDCG@10 mide la calidad de las diez primeras posiciones de un ranking respecto a las evaluaciones de relevancia disponibles. Un resultado útil contribuye más al principio de la lista que al final. La suma de esas contribuciones se divide por el resultado del mejor orden posible para la misma pregunta.
Si tenemos un documento muy relevante, desplazarlo del primer lugar al décimo empeora la evaluación. Si dos documentos tienen la misma relevancia, intercambiarlos no la cambia. En el caso habitual correctamente definido, 1 significa un orden ideal. La documentación de scikit-learn explica la normalización y las limitaciones de NDCG.
La métrica no indica si los números asignados a los documentos están bien calibrados para un umbral concreto. Por tanto, el mismo ranking puede conducir a distintas decisiones de «conservar/rechazar». El artículo sobre la dependencia de las puntuaciones del orden estudia esa diferencia.