Back to archive

Grokking

Model bezbłędnie odpowiada na zadania użyte do nauki, ale myli się w nowych przykładach tego samego rodzaju. Wygląda, jakby zapamiętał tabelę odpowiedzi. Trening trwa dalej i dopiero znacznie później wyniki na nowych przykładach gwałtownie się poprawiają.

Taką opóźnioną poprawę generalizacji, czyli działania na niewidzianych danych, nazywa się Grokking. Ważna jest różnica między szybkim sukcesem na zbiorze treningowym a późniejszym sukcesem poza nim.

W prostym zadaniu arytmetycznym model może wcześniej dopasować odpowiedzi do znanych par liczb, a dopiero później nauczyć się struktury pozwalającej obsłużyć nowe pary. Power i współautorzy, §2–3, badają taki przebieg na małych zadaniach algorytmicznych. Odkrycie reguły jest intuicją pomagającą czytać wynik, nie dowodem ludzkiego „zrozumienia” w modelu.

Do rozpoznania grokkingu potrzebujemy więc dwóch pomiarów: wyniku na danych uczących i na osobnych danych sprawdzających. Sam spadek błędu treningowego nie wystarczy. Zjawisko nie występuje w każdym treningu i nie obiecuje, że dowolny przeuczony model poprawi się, jeżeli tylko poczekamy dłużej.

Powiązania

42ah4⁝ Neural Feature Ansatz