Back to archive
#ai#llm#training#papers#aigen

Scale invariance

Zwiększasz wszystkie liczby w pewnej części modelu dwa razy. Czy zmienia to odpowiedź? Czasami kolejna operacja normalizacji usuwa wspólną skalę i wynik pozostaje taki sam. W innych układach takie przeskalowanie zmienia działanie.

Scale invariance oznacza niezmienniczość względem określonego przeskalowania. Trzeba powiedzieć, co skaluje się i co ma pozostać niezmienne: wyjście modelu czy wartość jego błędu. W kontekście tej notatki pytamy o wpływ mnożenia wag przez dodatnią liczbę.

Prosty przykład: listy [1, 2] i [2, 4] po podzieleniu przez ich długość geometryczną — pierwiastek z sumy kwadratów — dają ten sam znormalizowany kierunek. Normalizacja może więc usunąć informację o wspólnej wielkości. Dzięki temu kierunek zmian wag i ich rozmiar mają odmienne role w uczeniu.

Nie można jednak uznać całego Transformera za niezmienniczy tylko dlatego, że zawiera RMSNorm. Inne ścieżki obliczeń i końcowe oceny kandydatów mogą zachowywać wpływ skali. Badanie efektywnego kroku uczenia, §2 i §5, rozróżnia symetrię matematyczną od empirycznej podobności krzywych treningu.

Powiązania

42at⁝ Learning rate to za mało. Liczy się ELR

42at4⁝ RMSNorm