Back to archive
#ai#llm#training#papers#aigen

On-policy self-distillation

Student losuje własne rozwiązanie. Nauczyciel to ten sam model, tylko z przywilejem: dostaje odpowiedź (klucz albo pseudoetykietę) w prompcie. Potem student uczy się na swoich tokenach, token po tokenie, od tego nauczyciela. On-policy: dane są z bieżącej polityki, nie z obcego korpusu. Self: nie ma osobnego większego modelu.

W TTPO ta destylacja idzie tylko na kartkach, które zgadzają się z głosowaniem. Jak głos kłamie, nauczyciel i student i tak dzielą tę samą złą odpowiedź, więc update zsuwa się do destylacji myślenia w niemyślenie, nie do wlewania obcej pomyłki.

42av⁝ Głosowanie kłamie. Niezgoda zwykle nie

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.