Back to archive
#ai#papers#aigen#llm#training

Loss masking

Uczysz agenta na zapisach rozmów z narzędziami. Zapis zawiera jego polecenia oraz odpowiedzi narzędzi. Chcesz oceniać go za wybrane fragmenty, ale nadal pozwolić mu czytać pozostałe jako kontekst do następnego działania.

Loss masking określa, które pozycje wnoszą wkład do straty, czyli liczbowej oceny błędu podczas uczenia. Token — kawałek tekstu — może pozostać widoczny w wejściu, choć model nie jest bezpośrednio oceniany za jego przewidzenie.

Przy nauce na samych odpowiedziach agenta tekst użytkownika i wynik narzędzia pomagają wybrać dalszy krok, ale nie dostają własnej kary za przewidywanie. Model nie musi więc uczyć się generowania każdej części całego zapisu.

To różni się od Causal Masking, które ogranicza przepływ informacji między pozycjami. Brak składnika straty dla tokena nie musi oznaczać braku wpływu na trening: jego obliczenia mogą wpływać na oceniane późniejsze pozycje. Praca „Don’t Mask the Environment”, §2, bada konsekwencje wyboru ocenianych fragmentów.

Zobacz także: Sequence Packing pokazuje, dlaczego przy łączeniu przykładów trzeba osobno kontrolować dostęp do kontekstu i pozycje oceniane przez stratę.

Sześć tokenów pozostaje w jednym rzędzie, lecz tylko trzy pomarańczowe są połączone z szalką symbolizującą stratę.