Back to archive

µP I Transfer Hyperparametrów

Ustalenie dobrego kroku uczenia wymaga prób. Dla ogromnego modelu każda próba jest droga. Czy można znaleźć dobre ustawienia w małej sieci i wykorzystać je po zwiększeniu jej szerokości, czyli liczby elementów w warstwach?

Maximal Update Parametrization (µP) to sposób skalowania parametrów i ich aktualizacji przy zmianie szerokości sieci. Ma utrzymywać porównywalny charakter uczenia, dzięki czemu część hiperparametrów — ustawień wybieranych przed treningiem — można przenosić z mniejszych modeli.

W praktyce najpierw przygotowujemy mały model zgodnie z µP, sprawdzamy kilka wielkości kroku uczenia, a następnie zwiększamy model z zachowaniem właściwych reguł skalowania. To więcej niż skopiowanie jednej liczby do dowolnej większej sieci: znaczenie ma również sposób inicjalizacji i parametryzacji poszczególnych warstw.

Yang i współautorzy, §2–3, opisują transfer ustawień i testy tej metody. Oszczędność polega na tańszym strojeniu, ale przenoszenie ma określony zakres. Zmiana danych, architektury, głębokości lub reguły uczenia może wymagać osobnej kontroli. Zobacz także późniejszą pracę wskazaną w pierwotnej notatce.

Powiązania

42ah⁝ Czy możemy zbudować teorię fizyki procesu uczenia, która przewiduje makroskopowe zachowania sieci?