Recall@k
Recall@k mierzy, jaka część znanych trafnych dokumentów znalazła się w pierwszych k wynikach wyszukiwania. Liczymy trafne dokumenty na tej krótkiej liście i dzielimy ich liczbę przez liczbę wszystkich dokumentów oznaczonych jako trafne dla danego pytania. Wyższa wartość jest lepsza.
Przykład przygotowany do wyjaśnienia: badacz wskazał trzy publikacje pomocne dla konkretnego problemu. Wyszukiwarka zwróciła pięć wyników, w tym dwie ze wskazanych publikacji. Recall@5 wynosi 2/3, czyli około 0,67. Trzecia użyteczna praca na szóstej pozycji nie zwiększy Recall@5. Dwie użyteczne pozycje na pięć wyników dają zarazem precision@5 = 2/5 = 0,40; to inna metryka, z innym mianownikiem.
W opisie ScholarCatalyst trafna praca oznacza publikację, której pomysł autor projektu uznał za pomocny lub potencjalnie pomocny. Oficjalny kod liczy Recall@k osobno dla każdego pytania, a potem uśrednia te wartości. Nie sumuje najpierw wszystkich trafień z całego benchmarku.
Metryka zależy od etykiet. Użyteczna praca nieznana osobom nadającym etykiety nie zostanie zaliczona jako trafienie, a wysokie Recall@k nie dowodzi, że agent potrafi zastosować znaleziony pomysł. Aby oddzielić błędy wyszukiwania od błędów końcowego wyboru, porównaj pozytywne dokumenty widziane przez agenta z tymi, które zwrócił na liście.
Źródła: ScholarCatalyst i oficjalny kod ewaluacji.
Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.