Wissensdestillation
Ein großes Modell löst die Aufgabe gut, ist aber für den täglichen Einsatz zu teuer. Ein kleineres Modell könnte versuchen, sein Verhalten nachzubilden. Es braucht jedoch Beispiele oder Bewertungen, die mehr zeigen als nur eine Liste korrekter Etiketten.
Knowledge Distillation ist das Trainieren eines Schülermodells mit den Ausgaben oder Vorhersagen eines Lehrermodells. Der Schüler verändert dabei tatsächlich seine Parameter; eine bloße Anfrage an den Lehrer ist kein Training.
Wenn der Lehrer A die Wahrscheinlichkeit 0,60, B 0,35 und C 0,05 gibt, lässt das Etikett „A“ die Information aus, dass B eine nahe Alternative ist. Der Schüler kann lernen, die gesamte Verteilung nachzubilden. Eine andere Variante verwendet vollständige, vom Lehrer erzeugte Texte.
Der Lehrer muss kein einzelnes größeres Modell sein, dient klassisch aber als Quelle des nachzuahmenden Verhaltens. Die Destillation kann auch Fehler übertragen. KL Divergence hilft, die Übereinstimmung der Vorhersagen zu messen; On-policy self-distillation ist eine speziellere Konstruktion der Daten und des Lehrers.
Mechanismus und Details
In Distilling the Knowledge in a Neural Network, §2 beschreiben Hinton, Vinyals und Dean das Lernen anhand weicher Wahrscheinlichkeitsverteilungen. Eine erhöhte Temperatur macht mehr Informationen über die Beziehungen zwischen Kandidaten sichtbar. Beim Vergleich der Verteilungen wird derselbe Parameter für Lehrer und Schüler verwendet. Die Autoren kombinieren dieses Ziel mit dem Lernen anhand korrekter Labels, sofern diese verfügbar sind.
Mehr Informationen als eine einzelne Antwort
Eigenes Beispiel: Der Lehrer weist den beispielhaften Tokens A, B und C die Wahrscheinlichkeiten 0,60; 0,35; 0,05 zu. Das Etikett „A“ benennt nur den Gewinner. Die gesamte Verteilung zeigt auch, dass B wesentlich wahrscheinlicher als C war. Der Schüler kann versuchen, diese Verhältnisse mit Cross-entropy oder entsprechend gerichteter KL Divergence nachzubilden. Das ist ein zusätzliches Trainingssignal, kein Beweis für die Richtigkeit der Etiketten des Lehrers.
Bei texterzeugenden Modellen muss man den Vergleich von Verteilungen des nächsten Tokens vom Lernen anhand vollständiger erzeugter Sequenzen unterscheiden. Kim und Rush, Sequence-Level Knowledge Distillation, §2.2–3.2 beschreiben beide Ansätze für die maschinelle Übersetzung. In der sequenzbasierten Variante trainiert der Schüler auf Ausgaben, die die Beam Search des Lehrers gefunden hat. Der Text einer solchen Antwort enthält nicht die vollständigen Wahrscheinlichkeiten aller alternativen Tokens.
Das Ergebnis hängt vom Lehrer, den Daten und den Fähigkeiten des Schülers ab. Es bedeutet weder eine Kopie sämtlicher Fähigkeiten noch eine garantierte Verbesserung bei jeder Aufgabe. Die separate Notiz On-Policy-Selbstdestillation beschreibt eine besondere Variante in TTPO; ihre Bedingungen sind keine allgemeine Definition der Wissensdestillation.