LM head
Model przetworzył „Dziś piję” i ma wewnętrzny opis tej treści jako listę liczb. Użytkownik czeka jednak na tekst. Potrzebujemy przejścia od opisu ukrytego w modelu do ocen kandydatów na kolejny fragment odpowiedzi.
LM head to końcowa warstwa modelu językowego, która wylicza ocenę każdego tokena ze słownika. Token jest kawałkiem tekstu, a jego ocena przed przeliczeniem na prawdopodobieństwo nazywa się logitem.
W uproszczonym przykładzie opis wejścia wynosi (2, 1). Kandydat z wagami (1, 0) otrzymuje 2, a kandydat z wagami (0, 1) otrzymuje 1: mnożymy odpowiadające sobie liczby i dodajemy wyniki. Softmax zamienia oceny na prawdopodobieństwa. Dopiero reguła generowania wybiera token — najwyżej oceniony lub wylosowany.
LM head sama nie sprawdza prawdziwości odpowiedzi. Mała zmiana ukrytego opisu może też zmienić zwycięzcę, jeśli kandydaci są blisko siebie. Oryginalny Transformer, §3.4, opisuje projekcję wyjścia na słownik. Artykuł o kwantyzacji pokazuje, jak różnica wcześniejszych obliczeń dochodzi do tego etapu.