Loss Masking
Du trainierst einen Agenten anhand von Aufzeichnungen seiner Gespräche mit Werkzeugen. Die Aufzeichnung enthält seine Befehle und die Antworten der Werkzeuge. Du möchtest ihn für ausgewählte Abschnitte bewerten, ihm aber weiterhin erlauben, die übrigen als Kontext für die nächste Aktion zu lesen.
Loss Masking legt fest, welche Positionen zum Verlust beitragen, also zur numerischen Bewertung des Fehlers beim Lernen. Ein Token — ein Stück Text — kann in der Eingabe sichtbar bleiben, obwohl das Modell nicht direkt für seine Vorhersage bewertet wird.
Beim Lernen allein aus den Antworten des Agenten helfen der Nutzertext und das Werkzeugergebnis bei der Wahl des nächsten Schritts, erhalten aber keine eigene Strafe für ihre Vorhersage. Das Modell muss also nicht lernen, jeden Teil der gesamten Aufzeichnung zu erzeugen.
Das unterscheidet sich von Causal Masking, das den Informationsfluss zwischen Positionen begrenzt. Ein fehlender Verlustterm für ein Token muss nicht bedeuten, dass es keinen Einfluss auf das Training hat: Seine Berechnungen können später bewertete Positionen beeinflussen. Die Arbeit „Don’t Mask the Environment“, §2, untersucht die Folgen der Auswahl bewerteter Abschnitte.
Siehe auch: Sequence Packing zeigt, warum beim Zusammenfügen von Beispielen der Zugang zum Kontext und die vom Verlust bewerteten Positionen getrennt gesteuert werden müssen.
