Back to archive
#ai#papers#aigen#llm#inference

LM head

LM head to końcowa warstwa modelu językowego, która przekształca wektor opisujący przetworzony tekst w ocenę każdego tokena ze słownika. W typowej liniowej LM head każdemu tokenowi odpowiada wiersz macierzy wag. Ocena, nazywana logitem, powstaje z sumy iloczynów jego wag i współrzędnych wektora wejściowego.

Przy wejściu (2, 1) token z wektorem wag (1, 0) uzyska ocenę 2, a token z wagami (0, 1) ocenę 1. Dla wejścia (2, 3) oceny wyniosą odpowiednio 2 i 3, więc ich kolejność się zmieni. Przykład pomija pozostałe tokeny i ewentualny składnik bias, czyli stałą dodawaną do oceny.

Operacja softmax przelicza logity na prawdopodobieństwa. Dopiero reguła generowania wybiera token, na przykład biorąc największe prawdopodobieństwo albo losując z rozkładu. Niewielka zmiana logitów może zmienić zwycięzcę, jeśli kandydaci mieli zbliżone wyniki.

W 42da⁝ Błędy kwantyzacji częściowo znoszą się między warstwami modelu LM head pozostaje w pierwotnej precyzji, lecz otrzymuje zmieniony wektor z wcześniejszych warstw. Jego wpływ na poszczególne tokeny zależy od kierunków ich wektorów wag.

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.