Transformer
Transformer to architektura sieci neuronowej, która przetwarza sekwencję przez kolejne bloki attention i sieci przekształcające reprezentację każdej pozycji. Mechanizm Self-attention pozwala wymieniać informacje między pozycjami bez przechodzenia przez nie krok po kroku jak w sieci rekurencyjnej.
Na wejściu identyfikatory tokenów są zamieniane na wektory. Informację o ich kolejności dostarcza Positional Encoding. Wewnątrz bloku Multi-Head Attention łączy informacje z dostępnych pozycji, a sieć feed-forward przekształca wynik osobno dla każdej pozycji. Połączenia residual i normalizacja pomagają przekazywać sygnał przez kolejne bloki. Takie elementy można zobaczyć w implementacji TensorFlow.
Encoder i decoder
Oryginalny model z pracy Vaswani et al., Attention Is All You Need, §3 miał encoder i decoder. Encoder tworzył reprezentację zdania wejściowego, a decoder korzystał z niej podczas generowania tłumaczenia.
Na przykład przy tłumaczeniu „Pociąg przyjedzie jutro” decoder wyznacza rozkład prawdopodobieństwa następnego tokena na podstawie wejścia i już dostępnej części odpowiedzi. Obliczenia wielu pozycji podczas treningu można wykonywać równolegle; generowanie nowej odpowiedzi nadal może przebiegać token po tokenie.
Nazwa Transformer nie określa jednego rozmiaru modelu ani jednego celu uczenia. Istnieją warianty encoder-only i decoder-only, więc szczegółów oryginalnego układu nie należy przypisywać każdemu LLM. TensorFlow omawia te warianty na końcu przewodnika.
Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.