Back to archive
#ai#papers#aigen#llm#training

Loss masking

Loss masking określa, które pozycje sekwencji wpływają na funkcję straty podczas treningu. Token może pozostać w wejściu i pomagać w przewidywaniu późniejszych tokenów, mimo że model nie jest oceniany za przewidywanie tego tokena. Maska straty i ukrywanie fragmentu kontekstu to różne operacje.

Sześć tokenów pozostaje w jednym rzędzie, lecz tylko trzy pomarańczowe są połączone z szalką symbolizującą stratę.

W uczeniu agenta zapis może zawierać polecenie, odpowiedź narzędzia i kolejne polecenie. Jeżeli strata obejmuje tylko tekst agenta, odpowiedź narzędzia nadal jest widoczna przed wyborem następnej akcji. Nie dostarcza jednak własnego składnika straty za przewidywanie wyniku wcześniejszej akcji.

W ActObs, równanie 1, do celów treningu dołączono tokeny obserwacji. W podstawowym wariancie mają taką samą wagę jak tokeny akcji, a początkowe polecenie użytkownika pozostaje zamaskowane. Średnią oblicza się po liczbie ocenianych tokenów, więc włączenie obserwacji zmienia zarówno licznik, jak i mianownik. Przykładowo trzy tokeny akcji i dwa obserwacji dają pięć ocenianych pozycji zamiast trzech.

Zastosowanie i ograniczenia tej zmiany opisuje artykuł o ActObs. Dotyczy ona celów przewidywania w treningu; podczas pracy agenta wynik polecenia nadal dostarcza rzeczywiste narzędzie.

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.