Zurück zum Archiv
#ai#llm#training#papers#aigen

On-Policy-Selbstdestillation

Du möchtest ein Modell verbessern, hast aber keinen eigenen stärkeren Lehrer. Dasselbe Modell kann jedoch einen zusätzlichen Hinweis erhalten, etwa die Antwort im Aufgabentext. Kann seine besser informierte Version die Version ohne diesen Hinweis trainieren?

On-policy Self-distillation nutzt genau diese Beziehung. Der Schüler erzeugt Proben nach seiner aktuellen Art zu antworten — daher „on-policy“. Der Lehrer stammt aus demselben Modell — daher „self“ — und bewertet seine aufeinanderfolgenden Tokens, also Textstücke. Der Schüler lernt aus diesen Bewertungen, statt nur ein fertiges Dokument zu kopieren.

In der in TTPO beschriebenen Variante, §2.2 und §3.3, erhält der Lehrer die Antwort als zusätzlichen Kontext. Verglichen werden die Vorhersagen der nächsten Tokens bei dem vom Schüler erzeugten Text. Das ist eine besondere Form von Knowledge Distillation.

Zusätzlicher Kontext kann das Signal verbessern, aber ein falscher Hinweis kann es verzerren. Die Methode beweist nicht, dass das Modell ohne Quelle eine neue Wahrheit geschaffen hat. Entscheidend ist, woher die Proben stammen, welchen Vorteil der Lehrer hat und welche seiner Vorhersagen wir tatsächlich nutzen.

Verbindungen

Abstimmungen lügen. Abweichungen meist nicht