Zurück zum Archiv
#ai#llm#training#papers#aigen

Weight Decay

Das Modell passt sich immer besser an die Daten an, und die Gewichte — Zahlen, die Berechnungen steuern — entfernen sich von null. Du möchtest dieses Wachstum begrenzen, ohne Millionen Werte von Hand zu korrigieren. Du brauchst eine Regel, die bei jedem Lernschritt wirkt.

Weight Decay zieht Gewichte in Richtung null. In der Variante, die von der eigentlichen Korrektur des Lernalgorithmus getrennt ist, wird jedes Gewicht mit einem Faktor etwas kleiner als 1 multipliziert und dann entsprechend der Information aus den Daten verändert.

Beträgt der Verkleinerungsfaktor 0,99, wird das Gewicht 2 zu 1,98 und das Gewicht −2 zu −1,98, bevor die Lernkorrektur berücksichtigt wird. Es schrumpft also der Abstand zu null, nicht immer der Zahlenwert selbst. Das bedeutet nicht, dass jedes Gewicht letztlich gegen null geht: Die Datenkorrektur kann in die entgegengesetzte Richtung wirken. Die Größe des Schrumpfens hängt vom eingestellten Lernschritt und dem Decay-Koeffizienten ab. Loshchilov und Hutter, §2, erklären die Trennung von Weight Decay und der Änderung aus dem Gradienten.

Die Kontrolle der Gewichtsskala kann sowohl die Anpassung an neue Daten als auch die Trainingsdynamik beeinflussen. In der Studie zum effektiven Lernschritt, §4, wurde die zweite Rolle untersucht. Das ist ein Ergebnis unter den untersuchten Bedingungen, kein Beweis dafür, dass kleinere Gewichte immer ein besseres Modell bedeuten.

Verbindungen

Die Lernrate allein reicht nicht. Entscheidend ist ELR [Polski]

Siehe auch: AdamW [Polski] — eine Art, Weight Decay außerhalb des Mechanismus zur Schrittwahl von Adam [Polski] anzuwenden.