Autoregressive Language Modeling
Zaczynasz zdanie „Dziś piję…”. Po dopisaniu „herbatę” możliwości dalszego ciągu są inne niż po „wodę”. Model musi uwzględniać już wybrany tekst przy każdym kolejnym kroku, zamiast niezależnie zgadywać wszystkie miejsca.
Autoregressive Language Modeling opisuje tekst przez prawdopodobieństwa kolejnych tokenów, czyli kawałków tekstu, zależnych od wcześniejszych tokenów. Model wyznacza szanse możliwych kontynuacji, a osobna reguła wybiera, co dopisać.
Po wybraniu „herbatę” ten fragment trafia do kontekstu następnego kroku. Prawdopodobieństwo całego ciągu powstaje z połączenia prawdopodobieństw kolejnych wyborów. Podczas uczenia tekst jest znany, więc można oceniać przewidywania względem rzeczywistych dalszych fragmentów.
„Autoregressive” określa sposób modelowania, a nie nazwę jednej architektury. Nie oznacza też, że najbardziej prawdopodobna kontynuacja jest prawdziwa. Causal Masking umożliwia trenowanie wielu pozycji naraz bez podglądania ich przyszłych odpowiedzi.
Mechanizm i szczegóły
Dla sekwencji o ustalonej długości zapis wygląda tak:
oznacza token na pozycji , wcześniejszy prefiks, a parametry modelu. Pierwszy czynnik nie ma wcześniejszych tokenów tekstu; implementacja może używać znacznika początku. Model z ograniczonym oknem kontekstu korzysta tylko z dostępnej końcówki prefiksu. Taki rozkład i neuronowy model przewidywania następnego słowa opisują Bengio et al., A Neural Probabilistic Language Model, §1.2 i §2.
Uczenie i generowanie
Własny przykład: po tekście „Dziś piję” model przypisuje prawdopodobieństwa możliwym kontynuacjom. Gdy procedura generowania wybierze token odpowiadający „herbatę”, trafia on do prefiksu następnego kroku. Sam rozkład nie rozstrzyga, czy wybrać największe prawdopodobieństwo, czy losować.
Podczas uczenia znana jest poprawna sekwencja. Optymalizator zwiększa logarytmiczne prawdopodobieństwo jej kolejnych tokenów. Pierwotny GPT, §3.1, stosuje ten cel do tokenów tekstu, korzystając z Transformer decoder.
Causal Masking wraz z przesunięciem celów pozwala obliczać przewidywania dla wielu pozycji równolegle bez ujawniania odpowiedzi. Vaswani et al., §3.1, opisują to dla dekodera. Zależność generowanych tokenów od wcześniejszych wyborów pozostaje sekwencyjna.
To sposób modelowania rozkładu, a nie nazwa architektury: występował przed Transformer. W typowym modelu generującym tekst LM head dostarcza logity, z których Softmax wyznacza rozkład następnego tokena.