Order-consistency SFT
Order-consistency supervised fine-tuning pokazuje scorerowi co najmniej dwie kolejności tego samego zestawu kandydatów. Dla każdego kandydata model oblicza osobny score w każdej kolejności, a dodatkowy składnik straty karze rozrzut tych scores wokół ich średniej.
Przykładowo dokument A dostaje 0,70 w pierwszej kolejności i 0,60 w drugiej. Średnia wynosi 0,65. Consistency penalty zawiera dwa kwadraty odchyleń o 0,05 i dąży do zbliżenia obu wyników. Osobna strata względem etykiety teacher modelu pozostaje potrzebna, bo sam warunek zgodności pozwoliłby stworzyć scorer zawsze zwracający tę samą, bezużyteczną liczbę.
W artykule o stabilności decyzji autorzy używają dwóch przetasowań w kroku treningowym i tylko jednego przebiegu podczas zwykłej inferencji. Metoda ogranicza zależność od kolejności, ale jej nie usuwa.
Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.