RMSNorm
Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.
RMSNorm (Root Mean Square Layer Normalization) normalizuje wektor aktywacji przez jego RMS, bez odejmowania średniej jak w LayerNorm:
γ to uczący się wektor gainów. W pre-norm Transformerze RMSNorm stoi przed attention i FFN. Resetuje skalę na tej gałęzi, ale nie na residualu. Stąd sieć nie jest scale-invariant.
W pracy o ELR QK-Norm i uczące się gaine RMSNorm zaostrzają zapaść krzywych lossu. Jak gaine się zamrozi, model staje się bardziej niewrażliwy na skalę, a zapaść ELR słabnie (błąd rośnie z rzędu 10⁻³ do 10⁻²). Czyli gaine nie są ozdobą: coś w dynamice treningu ich potrzebuje, a statyczna symetria skali tego nie tłumaczy.
42at⁝ Learning rate to za mało. Liczy się ELR
42at3⁝ Scale invariance