Back to archive
#ai#papers#aigen#llm#information-retrieval

Dense retrieval

Dense retrieval to wyszukiwanie dokumentów przez podobieństwo wektorów obliczonych przez wyuczony model. Model zamienia zapytanie na listę liczb i robi to samo dla dokumentów. Wyszukiwarka porównuje te reprezentacje, na przykład za pomocą podobieństwa cosinusowego, i zwraca dokumenty o najwyższych wynikach.

Wektory dokumentów można obliczyć wcześniej i zapisać w indeksie. Podczas obsługi pytania trzeba obliczyć reprezentację zapytania oraz wyszukać bliskie wektory. Jest to osobny koszt od późniejszego czytania i oceniania dokumentów przez model językowy.

Przykład przygotowany do wyjaśnienia: pytasz, jak rozpocząć zbieranie danych dla nieskutecznego jeszcze agenta. Praca o ocenie gotowych agentów może uzyskać wysoki wynik podobieństwa, bo opisuje podobne zadanie. Publikacja o uczeniu z demonstracji może zawierać przydatne rozwiązanie, lecz używać innego słownictwa. Trafienie zależy od reprezentacji wyuczonej przez model, nie tylko od wspólnych słów; mimo to podobieństwo wektorów nie gwarantuje przydatności pomysłu.

W opisie ScholarCatalyst Gemini Embedding 2 tworzy pierwszą listę prac na podstawie tytułów i abstraktów. Agent może wygenerować kolejne zapytania, lecz nadal korzysta z tego retrievera. Późniejszy reranking ocenia tylko dokumenty, które weszły do puli. Własny test powinien więc sprawdzać także obecność znanych użytecznych prac przed tym etapem.

Źródło zastosowania: ScholarCatalyst, dodatek C.1.

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.