Order-Consistency SFT
Du zeigst dem Modell dieselben Dokumente in zwei Reihenfolgen. Der Wert eines Dokuments verändert sich von 0,70 auf 0,60. Wenn du anschließend Dokumente unterhalb eines Schwellenwerts verwirfst, kann allein das Umordnen die Antwort des Systems verändern. Du möchtest diese Instabilität beim Training verringern.
Order-consistency SFT ist eine Methode zum weiteren Training eines bewertenden Modells, die zu übereinstimmenden Bewertungen desselben Kandidaten bei unterschiedlichen Reihenfolgen anregt. SFT bedeutet Supervised Fine-tuning: die Anpassung eines Modells anhand von Beispielen mit vorgegebenen Ergebnissen.
In unserem Beispiel beträgt der Mittelwert der beiden Bewertungen 0,65. Eine zusätzliche Strafe berücksichtigt die Abweichungen beider Ergebnisse von diesem Mittelwert und regt zu ihrer Annäherung an. Zugleich ist eine Bewertung gegenüber einem sinnvollen Etikett nötig: Ein Modell, das immer 0,65 zurückgibt, wäre konsistent, könnte aber gute Dokumente nicht von schlechten unterscheiden.
Die Autoren, §3, verbinden diese beiden Trainingsziele. Die Umordnungen werden beim Training eingesetzt; sie müssen nicht bei jeder späteren Anfrage wiederholt werden. Die Methode begrenzt den Einfluss der Reihenfolge, garantiert aber weder seine vollständige Entfernung noch korrekte Bewertungen außerhalb des geprüften Bereichs.