Back to archive
#ai#papers#aigen#information-retrieval#evaluation

nDCG@10

Wyszukiwarka zwraca dziesięć wyników. Dobre dokumenty mogą być na liście, ale jeśli najprzydatniejszy jest dopiero dziesiąty, czytelnik może do niego nie dotrzeć. Potrzebujesz oceny uwzględniającej zarówno trafność, jak i miejsce.

nDCG@10 mierzy jakość pierwszych dziesięciu pozycji rankingu względem dostępnych ocen trafności. Przydatny wynik wnosi więcej na początku listy niż na jej końcu. Sumę tych wkładów dzieli się przez wynik najlepszej możliwej kolejności dla tego samego pytania.

Jeśli mamy jeden bardzo trafny dokument, przesunięcie go z miejsca pierwszego na dziesiąte pogarsza ocenę. Jeśli dwa dokumenty mają identyczną ocenę trafności, ich wzajemna zamiana jej nie zmieni. W typowym poprawnie zdefiniowanym przypadku 1 oznacza kolejność idealną. Dokumentacja scikit-learn objaśnia normalizację i ograniczenia NDCG.

Metryka nie mówi, czy liczby przypisane dokumentom są dobrze skalibrowane do konkretnego progu. Ten sam ranking może więc prowadzić do różnych decyzji „zachowaj/odrzuć”. Tę różnicę bada artykuł o zależności ocen od kolejności.