Zurück zum Archiv
#ai#llm#training#papers#aigen

Pseudolabel

Du hast viele Trainingsbeispiele, aber niemand hat die richtigen Antworten angegeben. Daher lässt du das Modell sie schätzen und nutzt diese Schätzungen als Hinweise für weiteres Lernen. Was gelangt dabei eigentlich in die Daten?

Ein Pseudo-label ist ein automatisch gewonnenes Etikett, etwa durch eine Modellvorhersage oder die Abstimmung mehrerer seiner Antworten. Das Etikett bezeichnet das Ergebnis, auf dem das Lernen beruht. „Pseudo“ erinnert daran, dass es kein unabhängig bestätigter Lösungsschlüssel ist.

In einer beispielhaften Abstimmung liefern acht Lösungen die Antworten: dreimal A, zweimal B und drei unterschiedliche andere Ergebnisse. A kommt am häufigsten vor, obwohl es keine Mehrheit unterstützt. Diese Auswahl der größten Gruppe heißt Plurality. Das häufige Auftreten einer Antwort beweist nicht ihre Richtigkeit.

TTPO, §3.1 und §4, verwendet das ausgewählte Ergebnis, um Antworten auf unterschiedliche Trainingsverfahren zu verteilen. Das ist eine konkrete Arbeitsweise mit Pseudo-labels, keine allgemeine Eigenschaft des Begriffs. Das Hauptrisiko ist einfach: Trainieren wir das Modell mit seinen eigenen falschen Antworten wie mit der Wahrheit, können wir den Fehler verstärken.

Verbindungen

Abstimmungen lügen. Abweichungen meist nicht