LM Head
Das Modell hat „Heute trinke ich“ verarbeitet und besitzt eine interne Beschreibung dieses Inhalts als Zahlenliste. Der Nutzer wartet jedoch auf Text. Wir brauchen den Übergang von der im Modell verborgenen Beschreibung zu den Bewertungen der Kandidaten für das nächste Antwortfragment.
Der LM Head ist die letzte Schicht eines Sprachmodells, die für jedes Token im Vokabular eine Bewertung berechnet. Ein Token ist ein Textstück; seine Bewertung vor der Umrechnung in eine Wahrscheinlichkeit heißt Logit.
Im vereinfachten Beispiel beträgt die Eingabebeschreibung (2, 1). Ein Kandidat mit den Gewichten (1, 0) erhält 2, einer mit (0, 1) erhält 1: Wir multiplizieren die entsprechenden Zahlen und addieren die Ergebnisse. Softmax verwandelt Bewertungen in Wahrscheinlichkeiten. Erst die Generierungsregel wählt das Token — das höchstbewertete oder ein zufällig gezogenes.
Der LM Head selbst prüft nicht die Wahrheit der Antwort. Eine kleine Änderung der verborgenen Beschreibung kann auch den Gewinner ändern, wenn die Kandidaten nah beieinanderliegen. Der ursprüngliche Transformer, §3.4, beschreibt die Projektion der Ausgabe auf das Vokabular. Der Artikel über Quantisierung zeigt, wie eine Abweichung früherer Berechnungen diese Phase erreicht.