On-policy self-distillation
Chcesz poprawić model, ale nie masz osobnego silniejszego nauczyciela. Ten sam model może jednak uzyskać dodatkową wskazówkę, na przykład odpowiedź w treści zadania. Czy jego lepiej poinformowana wersja może uczyć wersję bez tej wskazówki?
On-policy self-distillation wykorzystuje właśnie taką relację. Student tworzy próbki zgodnie ze swoim bieżącym sposobem odpowiadania — stąd „on-policy”. Nauczyciel wywodzi się z tego samego modelu — stąd „self” — i ocenia jego kolejne tokeny, czyli kawałki tekstu. Student uczy się z tych ocen zamiast tylko kopiować gotowy dokument.
W wariancie opisanym w TTPO, §2.2 i §3.3, nauczyciel otrzymuje odpowiedź jako dodatkowy kontekst. Porównywane są przewidywania następnych tokenów przy tekście wytworzonym przez studenta. To szczególna postać Knowledge Distillation.
Dodatkowy kontekst może poprawić sygnał, ale błędna wskazówka może go zniekształcić. Metoda nie dowodzi, że model stworzył nową prawdę bez źródła. Ważne jest, skąd pochodzą próbki, jaki przywilej ma nauczyciel i które jego przewidywania rzeczywiście wykorzystujemy.