Implizite Regularisierung durch Hyperparameter
Implizite Regularisierung durch Hyperparameter
Zwei Modelle lernen mit denselben Beispielen und erreichen einen ähnlichen Trainingsfehler, aber eines kommt mit neuen Daten besser zurecht. Sie unterschieden sich nur im Trainingsverfahren. Woher kann der Unterschied kommen, wenn das Ziel dasselbe war?
Implicit Regularization bezeichnet den Einfluss des Lernverfahrens selbst auf die Auswahl einer Lösung. Viele Gewichtseinstellungen können die Daten abbilden. Die Lernschrittgröße, die Zahl der Beispiele pro Schritt und die Zufälligkeit ihrer Auswahl können dazu führen, dass das Training manche Lösungen häufiger erreicht als andere.
Stell dir mehrere Wege vor, die zu einem gleich guten Ergebnis bei den Übungen führen. Eine andere Art, diese Wege zu gehen, kann an einen anderen Ort führen, der sich bei einer neuen Prüfung anders verhält. Das ist eine Analogie für die Auswahl der Lösung, kein zusätzliches Wissen, das dem Modell gegeben wird.
Smith und Mitautoren, §2–3, analysieren diesen Einfluss bei Stochastic Gradient Descent [Polski], also dem Lernen mit zufällig ausgewählten Beispielgruppen. Nicht jede Änderung der Einstellungen verbessert die Generalisierung. Weight Decay kontrolliert die Gewichte explizit; in einfachen Varianten entspricht es einer zusätzlichen Strafe, weshalb nicht jede Regularisierung unter „implicit“ eingeordnet werden sollte.