Weight decay
Model coraz lepiej dopasowuje dane, a wagi — liczby sterujące obliczeniami — oddalają się od zera. Chcesz ograniczyć ten wzrost bez ręcznego poprawiania milionów wartości. Potrzebna jest reguła działająca podczas każdego kroku uczenia.
Weight decay przyciąga wagi w stronę zera. W wariancie oddzielonym od właściwej poprawki algorytmu uczenia każdą wagę mnoży się przez współczynnik nieco mniejszy od 1, a potem zmienia zgodnie z informacją z danych.
Jeśli współczynnik pomniejszenia wynosi 0,99, waga 2 przechodzi do 1,98, a waga −2 do −1,98, przed uwzględnieniem poprawki z uczenia. Kurczy się więc odległość od zera, a nie zawsze sama wartość liczbowa. Nie oznacza to, że każda waga ostatecznie zbliża się do zera: poprawka z danych może działać w przeciwną stronę. Wielkość tego kurczenia zależy od ustawionego kroku uczenia i współczynnika decay. Loshchilov i Hutter, §2, wyjaśniają oddzielenie weight decay od zmiany wynikającej z gradientu.
Kontrola skali wag może wpływać zarówno na dopasowanie do nowych danych, jak i na dynamikę treningu. W badaniu efektywnego kroku uczenia, §4, analizowano tę drugą rolę. To wynik w badanych warunkach, a nie dowód, że mniejsze wagi zawsze oznaczają lepszy model.
Powiązania
42at⁝ Learning rate to za mało. Liczy się ELR
Zobacz także: AdamW — sposób stosowania weight decay poza mechanizmem dobierania kroku Adam.