Back to archive
#ai#llm#training#papers#aigen

Delayed acceleration

Porównujesz dwa treningi. W pierwszym ograniczasz wzrost wag, w drugim tego nie robisz. Początkowo pierwszy ma gorszy wynik, więc wygląda na nietrafiony wybór. Pod koniec sytuacja się odwraca: dogania drugi i go wyprzedza.

Delayed acceleration nazywa korzyść, która staje się widoczna dopiero w późniejszej fazie treningu, w badaniu kontroli wielkości wag — liczb sterujących obliczeniami modelu. Wynik ocenia się przez loss, czyli liczbę mierzącą błąd modelu; niższa oznacza lepsze dopasowanie do badanego zadania.

Autorzy badania ELR, §4, wiążą ten przebieg z efektywnym krokiem uczenia. Gdy wagi rosną, zmiana określonej wielkości może stawać się relatywnie mniejsza. Weight decay albo Hyperball kontrolują tę skalę. Większe względne zmiany mogą jednocześnie przyspieszać zdobywanie użytecznego sygnału i zwiększać wahania, które wcześniej przesłaniają korzyść.

To wyjaśnienie konkretnego zaobserwowanego przebiegu, nie obietnica, że każda gorsza krzywa kiedyś stanie się lepsza. Aby porównać metody, trzeba uwzględnić odpowiednio długi trening i jego ustawienia. Przerwanie pomiaru wcześnie może zmienić ocenę eksperymentu.

Powiązania

42at⁝ Learning rate to za mało. Liczy się ELR

42at1⁝ Weight decay

42at2⁝ Hyperball