Order-consistency SFT
Pokazujesz modelowi te same dokumenty w dwóch kolejnościach. Wynik jednego z nich zmienia się z 0,70 na 0,60. Jeśli potem odrzucasz dokumenty poniżej progu, samo przetasowanie może zmienić odpowiedź systemu. Chcesz ograniczyć tę niestabilność podczas uczenia.
Order-consistency SFT to sposób dalszego uczenia modelu oceniającego, który zachęca do zgodnych ocen tego samego kandydata przy różnych kolejnościach. SFT oznacza supervised fine-tuning: dostosowywanie modelu na przykładach z zadanymi wynikami.
W naszym przykładzie średnia dwóch ocen to 0,65. Dodatkowa kara uwzględnia odchylenia obu wyników od tej średniej i zachęca do ich zbliżenia. Równocześnie potrzebna jest ocena względem sensownej etykiety: model zawsze zwracający 0,65 byłby zgodny, lecz nie odróżniałby dobrych dokumentów od złych.
Autorzy, §3, łączą te dwa cele treningu. Przetasowania są używane podczas uczenia; nie trzeba powtarzać ich przy każdym późniejszym zapytaniu. Metoda ogranicza wpływ kolejności, ale nie gwarantuje jego całkowitego usunięcia ani poprawności ocen poza sprawdzonym zakresem.