µP I Transfer Hyperparametrów
Ustalenie dobrego kroku uczenia wymaga prób. Dla ogromnego modelu każda próba jest droga. Czy można znaleźć dobre ustawienia w małej sieci i wykorzystać je po zwiększeniu jej szerokości, czyli liczby elementów w warstwach?
Maximal Update Parametrization (µP) to sposób skalowania parametrów i ich aktualizacji przy zmianie szerokości sieci. Ma utrzymywać porównywalny charakter uczenia, dzięki czemu część hiperparametrów — ustawień wybieranych przed treningiem — można przenosić z mniejszych modeli.
W praktyce najpierw przygotowujemy mały model zgodnie z µP, sprawdzamy kilka wielkości kroku uczenia, a następnie zwiększamy model z zachowaniem właściwych reguł skalowania. To więcej niż skopiowanie jednej liczby do dowolnej większej sieci: znaczenie ma również sposób inicjalizacji i parametryzacji poszczególnych warstw.
Yang i współautorzy, §2–3, opisują transfer ustawień i testy tej metody. Oszczędność polega na tańszym strojeniu, ale przenoszenie ma określony zakres. Zmiana danych, architektury, głębokości lub reguły uczenia może wymagać osobnej kontroli. Zobacz także późniejszą pracę wskazaną w pierwotnej notatce.