ScholarCatalyst: agent nie poprawił wyszukiwania użytecznych prac
Prosisz asystenta AI o literaturę do problemu, nad którym utknął twój zespół. Agent zmienia zapytania, przegląda wyniki i przygotowuje listę publikacji. Wszystkie dotyczą właściwej dziedziny, ale żadna nie podpowiada, jak obejść przeszkodę w projektowanym systemie.
Potrzebujesz pracy zawierającej pomysł, który da się wykorzystać: inny sposób zbierania danych, przydatny mechanizm uczenia albo eksperyment wyjaśniający, dlaczego dotychczasowa metoda zawodzi. Zgodność tematu jest za słabym kryterium. Publikacja o podobnym zadaniu może nie zawierać niczego, co pomoże na obecnym etapie projektu.
Agent może trafnie oceniać przeczytane materiały, a mimo to nie znaleźć potrzebnej pracy. Jeżeli kolejne zapytania sprowadzają go do tego samego fragmentu literatury, lepsza ocena kandydatów nie uzupełni brakującego pomysłu. System ponosi koszt dodatkowych wywołań modelu, lecz badacz nadal dostaje nieprzydatną listę.
W badaniu ScholarCatalyst agent oparty na tym samym retrieverze co prosta wyszukiwarka nie poprawił odzyskiwania prac uznanych przez autorów projektów za użyteczne. Osobny eksperyment z kontrolowaną podmianą kandydatów pokazał, że model potrafi wybrać więcej takich prac, kiedy wcześniej brakujące pozycje zostaną mu dostarczone. To rozdziela problem znajdowania materiału od problemu jego oceny.
Przydatność pracy zależy od pytania badacza
ScholarCatalyst testuje szukanie literatury dla otwartego pytania badawczego, zanim znane jest rozwiązanie. Etykieta pozytywna oznacza, że pomysł z danej publikacji pomógł lub mógłby pomóc w rozwijaniu projektu. Praca negatywna może być tematycznie bliska, lecz według autora projektu nie wnosi użytecznej wskazówki.
Badacze zebrali takie oceny od autorów ukończonych projektów. Autorzy poprawiali pytania odtworzone przez model, wskazywali inspiracje i oceniali dodatkowych kandydatów, także spoza bibliografii swojej pracy. To ważna zmiana celu ewaluacji: ani obecność cytowania, ani podobny tytuł nie stanowią same w sobie dowodu przydatności.
W głównym teście system zna tylko pytanie i przeszukuje lokalny zbiór tytułów oraz abstraktów. Nie dostaje gotowej publikacji opisującej rozwiązanie ani jej bibliografii. Nie ma też dostępu do internetu. Kandydatów filtruje się według daty publikacji pracy źródłowej; nie jest to odtworzenie dokładnej daty rozpoczęcia projektu.
Agent ocenia tylko prace, które trafiły do jego puli
Wyszukiwarka wykorzystująca dense retrieval zamienia pytanie i dokumenty na wektory liczb. Podobieństwo tych wektorów wyznacza pierwszą listę kandydatów. Jest to wyuczony sposób dopasowania tekstów, ale nie gwarancja, że znaleziony dokument zawiera pomysł potrzebny w konkretnym projekcie.
Agent może pisać kolejne zapytania i połączyć ich wyniki. Następnie model ocenia przydatność każdego kandydata na podstawie tytułu i abstraktu. Ponowne ustawienie dokumentów w kolejności, czyli reranking, działa już na tej ograniczonej puli. Praca, której agent nie znalazł, nie może wygrać tego etapu.
Poniższy przykład jest przygotowany wyłącznie do wyjaśnienia mechanizmu. Nazwy, dokumenty i liczby są umowne, nie pochodzą z benchmarku. Zespół chce zebrać przydatne trajektorie działania agenta, choć jego początkowa polityka jeszcze słabo radzi sobie z zadaniem. W naszym małym zbiorze są następujące prace:
| Praca | Co zawiera | Czy pomaga w tej przeszkodzie? |
|---|---|---|
| A | porównanie skuteczności gotowych agentów | nie |
| B | nowy interfejs narzędzi | nie |
| C | pomocniczy kontroler prowadzący agenta w początkowym zbieraniu danych | tak |
| D | zbiór zadań do oceny agentów | nie |
| E | analizę opóźnień wywołań narzędzi | nie |
| F | uczenie z gotowych demonstracji, zanim agent zacznie sam zbierać dane | tak |
Pierwsze zapytanie zwraca A, B, C i D. Model wybiera C oraz A do końcowej listy. Odzyskał jedną z dwóch użytecznych prac: Recall@k, czyli udział znanych użytecznych dokumentów w pierwszych k wynikach, wynosi dla tej listy Recall@2 = 1/2 = 0,50. Wyższa wartość jest lepsza; nie oznacza jednak odsetka rozwiązanych projektów.
Agent dopisuje kolejne zapytanie i dostaje A, D, E oraz B. Po usunięciu duplikatów ma pięć dokumentów: A, B, C, D i E. Ponownie ocenia ich przydatność, co wymaga dodatkowego wyszukiwania i wywołań modelu oceniającego. Nadal nie widzi F. Nawet idealny wybór z tej puli nie odzyska obu inspiracji.
Teraz wykonujemy test diagnostyczny. Wracamy do pierwszej puli i zastępujemy nieprzydatną pracę B brakującą pracą F. Liczba kandydatów się nie zmienia: model dostaje A, F, C i D. Jeżeli wybierze C oraz F, Recall@2 wzrośnie do 2/2 = 1,00. Dostarczenie F wymagało jednak znajomości prawidłowych etykiet. To kontrola eksperymentalna, nie metoda dostępna podczas zwykłego wyszukiwania.
Te kroki odpowiadają dwóm rzeczywistym procedurom w artykule. Agent łączy wyniki kolejnych zapytań i ocenia znalezione prace osobno. W diagnostyce autorzy podmieniają negatywnych kandydatów na brakujące pozytywne prace, zachowując rozmiar puli, a model porządkuje całą listę w jednym wywołaniu. Podmiana izoluje wpływ dostępności materiału bez zwiększania liczby kandydatów.
Dodatkowe wywołania nie poprawiły wyniku tego agenta
Główne porównanie obejmowało 687 pytań o konkretne kierunki badawcze, oznaczonych jako SubQ. Gemini Embedding 2, użyty bez agenta, uzyskał średni Recall@20 równy 0,46. Agent GPT-4.1 korzystający z tego samego retrievera, generujący kolejne zapytania i oceniający kandydatów, uzyskał 0,43. Są to wartości z tabeli 3, dla tego samego typu pytań i tej samej metryki.
Wynik 0,46 oznacza średni udział znanych pozytywnych prac odzyskanych w pierwszych dwudziestu wynikach, liczony osobno dla każdego pytania, a następnie uśredniony. Nie oznacza, że wyszukiwarka rozwiązała 46% problemów naukowych. Autorzy nie podają dla tej różnicy testu istotności; bezpieczny wniosek jest węższy: w tej konfiguracji dodatkowy proces agenta nie przyniósł obserwowanej poprawy.
Agent nie ograniczał się do przestawienia pierwszej listy. Wykonywał kolejne wyszukiwania, zbierał kandydatów i uruchamiał osobną ocenę modelu dla każdej pracy. Płacimy więc za generowanie zapytań i ich ocenę, a nie tylko za porównanie wektorów. Dokładne budżety i liczbę wywołań podaję w szczegółach eksperymentu.
Podmiana kandydatów ujawniła rezerwę w wyborze
Osobna diagnostyka z tabeli 20 dotyczyła 50 losowo wybranych głównych pytań badawczych, CoreQ. Tutaj nie testowano powyższego agenta GPT-4.1. Model Claude Fable 5.1 porządkował dwudziestu kandydatów pobranych przez Gemini Embedding 2. Dla zwykłej puli średni Recall@5 wynosił 0,31. Po podmianie negatywnych pozycji na brakujące pozytywne prace wzrósł do 0,60.
Ta kontrolowana zmiana wspiera wyjaśnienie, że dostępność użytecznych kandydatów ogranicza wynik rerankera. Nie dowodzi, że sama ocena działa bezbłędnie ani że znalezienie takich kandydatów jest łatwe. Model w diagnostyce miał też późniejszą granicę wiedzy niż modele z głównego porównania i mógł znać prace źródłowe. Wynik trzeba traktować jako analizę tej konkretnej konfiguracji, a nie jako czysty pomiar rozpoznawania nieznanych inspiracji.
W analizach przypadków autorzy znaleźli również sytuacje, w których agent zobaczył użyteczną pracę, a następnie odrzucił ją przy wyborze. Dostępność i ocena mogą zawodzić jednocześnie. Nie należy przypisywać wszystkich błędów wyszukiwarce.
Oceny po ukończeniu projektu mają ograniczenia
ScholarCatalyst jest preprintem, opublikowanym po raz pierwszy 1 października 2026 roku. Dotyczy agentów badawczych i information retrieval w informatyce. Autorzy projektów oceniali przydatność wcześniejszych prac już po znalezieniu własnego rozwiązania. Mogli lepiej dostrzegać związki, których nie widzieli na początku, a część etykiet opisuje potencjalną pomoc zamiast udokumentowanego wpływu.
Znany zestaw pozytywnych prac nie jest pełną listą wszystkich możliwych inspiracji. Pula do adnotacji powstała z bibliografii oraz kandydatów znalezionych przez inne systemy. Model może zaproponować użyteczną publikację, której nikt nie oznaczył. Dziedziny informatyki są reprezentowane nierównomiernie, a przeniesienia wyniku na medycynę czy chemię nie sprawdzono.
Badanie nie mierzy jakości późniejszych odkryć, czasu pracy naukowca ani skuteczności dowolnego komercyjnego asystenta. Główne agenty są implementacjami autorów, z ograniczonymi budżetami i tytułami oraz abstraktami jako materiałem do oceny. Wynik nie ustanawia więc ogólnego limitu systemów mających pełny tekst, sieć cytowań lub dodatkowy kontekst od użytkownika.
Przed zwiększeniem budżetu rozdziel dwa rodzaje braków
Moja praktyczna propozycja wynika z konstrukcji tego testu: przy ocenie asystenta do literatury zbierz znane zespołowi prace, których konkretne pomysły pomogły w projekcie. Zapisuj, czy agent zobaczył je podczas wyszukiwania, a dopiero potem sprawdzaj, czy trafiły na końcową listę. Nie wystarczy ocena, że wyniki dotyczą właściwego tematu.
Jeżeli użyteczna praca nigdy nie weszła do puli, sprawdź kontrolnie wynik po ręcznym dodaniu jej do kandydatów. Taka diagnostyka nie rozwiązuje wyszukiwania, ale pomaga zdecydować, czy rozwijać retriever, czy sposób oceny dokumentów. Przed opłaceniem kolejnych rund agenta zmierz osobno prace pominięte przez wyszukiwanie i prace znalezione, lecz odrzucone.
Szczegóły eksperymentu
- Dane ocenione przez autorów. 184 badaczy, 207 projektów informatycznych z lat 2025–2026, 207 CoreQ i 687 SubQ, łącznie 894 pytania. Główne wyniki powyżej dotyczą tego zbioru, a nie dodatkowego zbioru odtworzonego wyłącznie przez model.
- Korpus. 190 896 publikacji: rozpoznane pozycje bibliografii oraz dodatkowe prace arXiv. Przy każdym pytaniu obowiązuje filtr daty publikacji pracy źródłowej. Indeks używa tytułów i abstraktów. Praca źródłowa jest wykluczana z wyników.
- Główne porównanie, tabela 3. SubQ, Gemini Embedding 2 bez agenta kontra GPT-4.1 Tool-calling Agent z Gemini Embedding 2. Agent najpierw wyszukuje oryginalne pytanie, potem ma do pięciu rund wywołań narzędzi i pulę najwyżej 60 prac. Każde wyszukiwanie zwraca dziesięć pozycji. Model ocenia każdą pracę osobno od 0 do 10; przy remisie zachowana jest kolejność znalezienia. Granica wiedzy GPT-4.1 podana w pracy to czerwiec 2024, wcześniejszy niż publikacje źródłowe. Wywołania tego modelu używają temperature 0.
- Uzupełnianie krótkich rankingów. Końcowe listy agentów uzupełniano pracami widzianymi podczas wyszukiwania, a dalej rankingiem retrievera dla oryginalnego pytania. Dla Tool-calling Agent ranking był krótszy niż 20 pozycji w 10 spośród wszystkich 894 pytań; autorzy nie rozbijają tej liczby na CoreQ i SubQ. Nie należy przedstawiać każdego wyniku Recall@20 jako wyniku wyłącznie własnego wyboru agenta.
- Koszt, tabela 31. Dla GPT-4.1 Tool-calling Agent średnie po wszystkich 894 pytaniach wynoszą 5,8 wywołania narzędzi oraz 44,3 wywołania modelu na pytanie. Druga liczba obejmuje osobne oceny kandydatów. Nie jest to koszt tylko podzbioru SubQ ani porównanie przy jednakowym budżecie obliczeń.
- Diagnostyka, tabela 20 i dodatek D.2. 50 CoreQ, Gemini Embedding 2, pula K = 20, listwise reranking w jednym wywołaniu Claude Fable 5.1. Standard: Recall@5 = 0,31; oracle z gold injection: 0,60. Pula ma nadal 20 prac. Granica wiedzy Fable 5.1 to czerwiec 2026, po większości publikacji źródłowych. To ustawienie jest poza regułą wcześniejszej granicy wiedzy z głównego testu.
- Modele i checkpointy. Autorzy ewaluują udostępnione modele i API wymienione w dodatku C.1 oraz konfiguracji oficjalnego kodu. Nie raportują treningu na ScholarCatalyst ani wyboru najlepszego checkpointu z takiego treningu. Nie znamy pełnych procedur wyboru wag u dostawców; nazw API nie należy traktować jako gwarancji niezmiennej wersji w przyszłym odtworzeniu.
- Metryka. Recall@k jest udziałem oznaczonych pozytywnych prac w pierwszych k wynikach. Oficjalny kod liczy średnią wyników pytań, a nie jeden iloraz wszystkich trafień i wszystkich pozytywnych par. Większa wartość oznacza lepsze odzyskiwanie znanych inspiracji, nie ocenę późniejszego odkrycia.
Źródło: ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research, arXiv:2610.02202v1. Autorzy: Sohyeon Kim, Yoonho Lee, Bo Liu, Dayoon Ko, Rulin Shao, Seungone Kim, Graham Neubig, Pang Wei Koh, Aakanksha Chowdhery, Akari Asai, Omar Khattab, Yejin Choi, Gunhee Kim i Chelsea Finn. Podstawą opisu jest pełny oficjalny tekst, zwłaszcza tabele 3, 20 i 31 oraz dodatki C, D i E; definicję uśredniania sprawdziłem w kodzie ewaluacji.
Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.