Back to archive
#ai#aigen#llm#information-retrieval

Indeks wektorowy a wycofanie API modelu embeddingowego

Wyszukiwarka wektorowa zapisuje liczbowe reprezentacje dokumentów, aby nie obliczać ich przy każdym pytaniu. Nadal potrzebuje jednak modelu do przetwarzania nowych zapytań i dopisywanych dokumentów. Wycofanie jedynego API obsługującego ten model może więc wymusić ponowne przeliczenie całego korpusu. Dostęp do wag daje możliwość dalszego używania tego samego modelu u innego operatora lub na własnej infrastrukturze.

Nowy model zmienia reprezentację dokumentów

W wyszukiwaniu przez podobieństwo wektorów model zamienia tekst na listę liczb. Zapisany indeks zawiera wyniki działania konkretnego modelu. Podmiana modelu tworzącego wektor zapytania nie zapewnia zgodności z istniejącymi wektorami dokumentów: taka sama liczba współrzędnych nie oznacza, że mają one to samo znaczenie.

Simon Willison wskazuje tę zależność przy okazji EmbeddingGemma 2. Argumentuje, że dostawca zamkniętego modelu może zastąpić go nowszym, pozostawiając klientowi koszt ponownego obliczenia tysięcy lub milionów zapisanych wektorów. To argument dotyczący utrzymania indeksu, nie wynik porównania jakości modeli.

Przeliczenie korpusu jest potrzebne, gdy przechodzimy na reprezentację nowego modelu i nie mamy potwierdzonego sposobu zachowania zgodności. Obejmuje ponowne przetworzenie dokumentów oraz zbudowanie indeksu z nowych wyników. Zmiana samego adresu usługi nie rozwiązuje tego problemu.

Dostęp do wag pozwala zmienić operatora bez zmiany modelu

Willison opisuje wybór usługi hostowanej z możliwością samodzielnego uruchomienia jej modelu po wycofaniu API. W swoim komentarzu podaje, że EmbeddingGemma 2 ma licencję Apache 2.0. Jego preferencja nie wymaga utrzymywania własnego serwera od początku: ważna jest możliwość zachowania modelu, gdy dotychczasowy operator przestanie go udostępniać.

Dla istniejącego indeksu oznacza to rozdzielenie dwóch zmian. Przeniesienie obsługi tego samego modelu może zachować reprezentację dokumentów. Przejście na inny model wymaga osobnej oceny zgodności i jakości wyszukiwania, nawet jeśli nowa usługa przyjmuje identyczne żądania API.

Same wagi nie gwarantują identycznych wyników drugiego wdrożenia. Przed zmianą operatora trzeba porównać wektory i wyniki wyszukiwania dla tych samych tekstów, przy zachowaniu sposobu przygotowania wejścia i konfiguracji modelu. Jest to warunek wdrożeniowy wynikający z zależności indeksu od reprezentacji; komentarz Willisona nie przedstawia testu takiej migracji ani oszacowania jej kosztu.

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.