Back to archive
#ai#llm#training#papers#aigen

RMSNorm

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.

RMSNorm (Root Mean Square Layer Normalization) normalizuje wektor aktywacji przez jego RMS, bez odejmowania średniej jak w LayerNorm:

RMSNorm(x)i=γixiRMS(x)\mathrm{RMSNorm}(x)_i = \gamma_i \, \frac{x_i}{\mathrm{RMS}(x)}

γ to uczący się wektor gainów. W pre-norm Transformerze RMSNorm stoi przed attention i FFN. Resetuje skalę na tej gałęzi, ale nie na residualu. Stąd sieć nie jest scale-invariant.

W pracy o ELR QK-Norm i uczące się gaine RMSNorm zaostrzają zapaść krzywych lossu. Jak gaine się zamrozi, model staje się bardziej niewrażliwy na skalę, a zapaść ELR słabnie (błąd rośnie z rzędu 10⁻³ do 10⁻²). Czyli gaine nie są ozdobą: coś w dynamice treningu ich potrzebuje, a statyczna symetria skali tego nie tłumaczy.

42at⁝ Learning rate to za mało. Liczy się ELR
42at3⁝ Scale invariance