Delayed acceleration
Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.
Delayed acceleration to odwrócenie krzywych lossu przy kontroli normy. Run z weight decay (albo Hyperballem) na początku ma gorszy loss niż run bez kontroli. Pod koniec dogania i wyprzedza.
Dlaczego późno, skoro zysk jest zbierany wcześnie?
Bez kontroli normy wagi puchną, więc ELR η / ‖W‖_F spada szybciej niż sam learning rate. Weight decay to hamuje: ELR zostaje większy dłużej. Większy ELR to szybsze zbieranie "efektywnego czasu treningu" (sygnał), ale też więcej szumu optymalizacji. Szum widać od razu. Zysk w sygnale wychodzi dopiero, gdy LR schodzi, nowy szum milknie, a stary się zapomina.
Stąd nazwa: zysk nabywasz wcześnie, odczytujesz późno. Krótka faza decay może skończyć się zanim crossover w ogóle nastąpi.
42at⁝ Learning rate to za mało. Liczy się ELR
42at1⁝ Weight decay
42at2⁝ Hyperball