RMSNorm
Eine Schicht erhält eine Liste großer Zahlen, eine andere deutlich kleinere Werte. Solche Skalenunterschiede können Berechnungen und Lernen erschweren. Du möchtest die Gesamtgröße des Signals vereinheitlichen und dabei die Verhältnisse seiner Elemente erhalten.
RMSNorm teilt eine Zahlenliste durch ihren RMS, also die Quadratwurzel des Mittelwerts ihrer Quadrate. Anschließend kann jede Koordinate mit einem eigenen gelernten Koeffizienten multipliziert werden. Eine Zahlenliste ist ein Vektor; im Modell beschreibt sie das verarbeitete Textstück.
Für [3, 4] beträgt RMS etwa 3,54. Nach der Division erhalten wir etwa [0,85, 1,13]: Die gemeinsame Skala ist kleiner geworden, das Verhältnis gleich geblieben. Implementierungen fügen eine kleine Konstante zum Schutz vor der Division durch null hinzu. Zhang und Sennrich, §3, beschreiben diesen Mechanismus.
Im Unterschied zu Layer Normalization zieht RMSNorm den Mittelwert der Eingabezahlen nicht ab. Die Normalisierung eines einzigen Zweigs entfernt die Skala nicht aus allen Modellberechnungen, insbesondere nicht aus dem Pfad der Residual Connection, der die Eingabe weitergibt. Es ist eine lokale Operation, keine Garantie für die Invarianz des gesamten Netzes.
Verbindungen
Die Learning Rate allein reicht nicht. Entscheidend ist ELR [Polski]