Weight decay
Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.
Weight decay to mechanizm, który przy każdym kroku treningu trochę kurczy wagi. W wariancie decoupled (AdamW) wygląda to tak:
λ to współczynnik decay, Uₖ to update optimizeru. Im większe λ, tym mocniej wagi są ściągane w stronę zera.
Klasyczna historia brzmi: "to regularizacja, żeby model się nie przeuczał". W pretrainingu LLM-ów coraz częściej patrzy się na to inaczej: weight decay hamuje wzrost normy wag. A skoro ELR to η / ‖W‖_F, to pilnowanie normy to tak naprawdę pilnowanie efektywnego kroku.
Bez decay wagi puchną, ELR spada szybciej niż sam learning rate, i trening "mięknie" za wcześnie. Z decay ELR zostaje większy dłużej. Stąd w pracy o ELR wniosek: weight decay kształtuje loss głównie przez krzywą ELR, którą indukuje, a nie przez magię mniejszych wag.