Back to archive

Edge Of Stability

Podczas uczenia model poprawia swoje wagi małymi krokami. Oczekujesz, że błąd będzie spokojnie maleć. Tymczasem w niektórych eksperymentach wynik oscyluje, lokalne warunki wyglądają na niestabilne, a trening mimo to robi postępy. Jak opisać tę obserwację?

Edge of Stability to reżim uczenia, w którym największa lokalna krzywizna funkcji błędu utrzymuje się blisko granicy stabilności dla używanego kroku. Krzywizna mówi, jak gwałtownie zmienia się wskazówka „w którą stronę poprawiać wagi”. Na ostrej powierzchni ten sam krok łatwiej przeskakuje przez minimum.

Dla zwykłego gradient descent — aktualizacji wag w kierunku obniżania błędu — lokalna granica w prostym modelu kwadratowym wynosi 2/η, gdzie η to wielkość kroku uczenia. Cohen i współautorzy, §2–3, zaobserwowali utrzymywanie się w pobliżu tej granicy oraz oscylacje mimo spadku błędu w dłuższej perspektywie.

To opis dynamiki, a nie zalecenie, żeby celowo rozchwiać trening. Wyniku dla pełnego gradient descent nie wolno bez sprawdzenia przenosić na każdy optymalizator i każdy LLM. Scaling Laws dotyczą relacji zasoby–wynik; tutaj pytamy o przebieg samego uczenia.

Powiązania

42ah⁝ Czy możemy zbudować teorię fizyki procesu uczenia, która przewiduje makroskopowe zachowania sieci?