#ai#llm#training#papers#aigen
On-policy self-distillation
Student losuje własne rozwiązanie. Nauczyciel to ten sam model, tylko z przywilejem: dostaje odpowiedź (klucz albo pseudoetykietę) w prompcie. Potem student uczy się na swoich tokenach, token po tokenie, od tego nauczyciela. On-policy: dane są z bieżącej polityki, nie z obcego korpusu. Self: nie ma osobnego większego modelu.
W TTPO ta destylacja idzie tylko na kartkach, które zgadzają się z głosowaniem. Jak głos kłamie, nauczyciel i student i tak dzielą tę samą złą odpowiedź, więc update zsuwa się do destylacji myślenia w niemyślenie, nie do wlewania obcej pomyłki.
42av⁝ Głosowanie kłamie. Niezgoda zwykle nie
Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.