Implicit Regularization Przez Hyperparametry
Dwa modele uczą się na tych samych przykładach i osiągają podobny błąd treningowy, ale jeden radzi sobie lepiej z nowymi danymi. Różniły się tylko sposobem prowadzenia treningu. Skąd może brać się różnica, skoro cel był ten sam?
Implicit Regularization oznacza wpływ samej procedury uczenia na wybór rozwiązania. Wiele ustawień wag może dopasować dane. Wielkość kroku uczenia, liczba przykładów na krok i losowość ich wyboru mogą sprawić, że trening częściej trafia do niektórych rozwiązań niż do innych.
Pomyśl o kilku drogach prowadzących do równie dobrego wyniku na ćwiczeniach. Zmiana sposobu chodzenia po tych drogach może doprowadzić do innego miejsca, które różnie zachowa się na nowym sprawdzianie. To analogia wyboru rozwiązania, nie dodatkowa wiedza dodawana do modelu.
Smith i współautorzy, §2–3, analizują taki wpływ w stochastic gradient descent, czyli uczeniu z losowo wybieranymi grupami przykładów. Nie każda różnica ustawień poprawia generalizację. Weight decay stanowi jawną kontrolę wag; w prostych wariantach odpowiada dodatkowej karze, więc nie należy wrzucać każdej regularizacji do kategorii „implicit”.