Edge of Stability
Edge of Stability
Beim Training verbessert das Modell seine Gewichte in kleinen Schritten. Du erwartest, dass der Fehler ruhig abnimmt. In manchen Experimenten schwankt das Ergebnis jedoch, die lokalen Bedingungen wirken instabil, und trotzdem macht das Training Fortschritte. Wie lässt sich diese Beobachtung beschreiben?
Edge of Stability ist ein Trainingsregime, in dem die größte lokale Krümmung der Fehlerfunktion nahe der Stabilitätsgrenze des verwendeten Schritts bleibt. Die Krümmung beschreibt, wie rasch sich der Hinweis „in welche Richtung die Gewichte verbessern“ verändert. Auf einer scharfen Oberfläche springt derselbe Schritt leichter über das Minimum.
Für gewöhnlichen Gradient Descent — die Aktualisierung der Gewichte in Richtung einer Fehlerverringerung — beträgt die lokale Grenze in einem einfachen quadratischen Modell 2/η, wobei η die Größe des Lernschritts ist. Cohen und Mitautoren, §2–3, beobachteten ein Verbleiben nahe dieser Grenze und Schwankungen trotz einer längerfristigen Fehlerabnahme.
Das beschreibt die Dynamik und empfiehlt nicht, das Training absichtlich zu destabilisieren. Das Ergebnis für vollständigen Gradient Descent darf nicht ungeprüft auf jeden Optimierer und jedes LLM übertragen werden. Scaling Laws betreffen die Beziehung Ressourcen–Ergebnis; hier fragen wir nach dem Verlauf des Lernens selbst.