Back to archive
#ai#papers#aigen#llm#information-retrieval

Recall@k

Recall@k mierzy, jaka część znanych trafnych dokumentów znalazła się w pierwszych k wynikach wyszukiwania. Liczymy trafne dokumenty na tej krótkiej liście i dzielimy ich liczbę przez liczbę wszystkich dokumentów oznaczonych jako trafne dla danego pytania. Wyższa wartość jest lepsza.

Przykład przygotowany do wyjaśnienia: badacz wskazał trzy publikacje pomocne dla konkretnego problemu. Wyszukiwarka zwróciła pięć wyników, w tym dwie ze wskazanych publikacji. Recall@5 wynosi 2/3, czyli około 0,67. Trzecia użyteczna praca na szóstej pozycji nie zwiększy Recall@5. Dwie użyteczne pozycje na pięć wyników dają zarazem precision@5 = 2/5 = 0,40; to inna metryka, z innym mianownikiem.

W opisie ScholarCatalyst trafna praca oznacza publikację, której pomysł autor projektu uznał za pomocny lub potencjalnie pomocny. Oficjalny kod liczy Recall@k osobno dla każdego pytania, a potem uśrednia te wartości. Nie sumuje najpierw wszystkich trafień z całego benchmarku.

Metryka zależy od etykiet. Użyteczna praca nieznana osobom nadającym etykiety nie zostanie zaliczona jako trafienie, a wysokie Recall@k nie dowodzi, że agent potrafi zastosować znaleziony pomysł. Aby oddzielić błędy wyszukiwania od błędów końcowego wyboru, porównaj pozytywne dokumenty widziane przez agenta z tymi, które zwrócił na liście.

Źródła: ScholarCatalyst i oficjalny kod ewaluacji.

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.