Back to archive
#ai#llm#training#papers#aigen

Weight decay

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.

Weight decay to mechanizm, który przy każdym kroku treningu trochę kurczy wagi. W wariancie decoupled (AdamW) wygląda to tak:

Wk+1=(1ηkλ)WkηkUkW_{k+1} = (1 - \eta_k \lambda)\, W_k - \eta_k U_k

λ to współczynnik decay, Uₖ to update optimizeru. Im większe λ, tym mocniej wagi są ściągane w stronę zera.

Klasyczna historia brzmi: "to regularizacja, żeby model się nie przeuczał". W pretrainingu LLM-ów coraz częściej patrzy się na to inaczej: weight decay hamuje wzrost normy wag. A skoro ELR to η / ‖W‖_F, to pilnowanie normy to tak naprawdę pilnowanie efektywnego kroku.

Bez decay wagi puchną, ELR spada szybciej niż sam learning rate, i trening "mięknie" za wcześnie. Z decay ELR zostaje większy dłużej. Stąd w pracy o ELR wniosek: weight decay kształtuje loss głównie przez krzywą ELR, którą indukuje, a nie przez magię mniejszych wag.

42at⁝ Learning rate to za mało. Liczy się ELR