Zurück zum Archiv

µP und Hyperparametertransfer

µP und Hyperparametertransfer

Einen guten Lernschritt festzulegen erfordert Versuche. Für ein riesiges Modell ist jeder Versuch teuer. Lassen sich gute Einstellungen in einem kleinen Netz finden und nach der Vergrößerung seiner Breite, also der Zahl der Elemente in den Schichten, weiterverwenden?

Maximal Update Parametrization (µP) ist eine Methode zum Skalieren der Parameter und ihrer Aktualisierungen bei Änderungen der Netzbreite. Sie soll den Charakter des Lernens vergleichbar halten, sodass einige Hyperparameter — vor dem Training gewählte Einstellungen — von kleineren Modellen übertragen werden können.

Praktisch bereiten wir zuerst ein kleines Modell nach µP vor, prüfen mehrere Lernschrittgrößen und vergrößern dann das Modell unter Einhaltung der passenden Skalierungsregeln. Das ist mehr als das Kopieren einer einzigen Zahl in ein beliebiges größeres Netz: Auch die Initialisierung und Parametrisierung einzelner Schichten spielen eine Rolle.

Yang und Mitautoren, §2–3, beschreiben die Übertragung der Einstellungen und Tests dieser Methode. Die Einsparung entsteht durch günstigeres Abstimmen, aber die Übertragung hat einen bestimmten Geltungsbereich. Änderungen von Daten, Architektur, Tiefe oder Lernregel können eine eigene Prüfung erfordern. Siehe auch die spätere Arbeit, auf die die ursprüngliche Notiz verwies.

Verbindungen

Können wir eine physikalische Theorie des Lernprozesses entwickeln, die das makroskopische Verhalten von Netzen vorhersagt? [Polski]