Pre-training
Chcesz, żeby model rozpoznawał zależności w języku, zanim dostosujesz go do konkretnej pracy, np. klasyfikowania wiadomości klientów. Ręczne przygotowanie odpowiedzi do całego tekstu byłoby niewykonalne. Można jednak z samego tekstu tworzyć zadania uczące.
Pre-training to etap wykształcania parametrów, które stanowią punkt wyjścia do dalszego użycia lub adaptacji modelu. Parametry są liczbami sterującymi jego obliczeniami. W modelach językowych sygnał często powstaje z dużego zbioru tekstów.
Ze zdania „Ala ma kota” można zrobić zadanie przewidzenia następnego fragmentu po „Ala ma” albo odtworzenia ukrytego słowa w „Ala [MASK] kota”. Oba ćwiczenia wykorzystują istniejący tekst, choć uczą przy innym dostępie do kontekstu.
Nazwa etapu nie narzuca jednego zadania ani architektury. Model po pre-trainingu nie musi jeszcze dobrze wykonywać poleceń użytkownika. Fine-tuning może później dostosować go do wybranych przykładów i zachowań.
Mechanizm i szczegóły
Nazwa określa rolę etapu w procesie uczenia. Nie narzuca jednej architektury ani jednej funkcji celu.
Ten sam etap, różne zadania
W pierwotnym GPT model uczy się przewidywania następnego tokena na podstawie wcześniejszych. To Autoregressive Language Modeling. Autorzy opisują ten etap przed adaptacją do zadań z etykietami w Improving Language Understanding by Generative Pre-Training, §3.1–3.2.
Oryginalny BERT korzysta z innego zestawu celów: odtwarza wybrane tokeny po zaburzeniu wejścia oraz rozpoznaje, czy dwa fragmenty następowały po sobie w korpusie. Przy odtwarzaniu tokena może wykorzystywać kontekst po obu stronach. Są to konkretne zadania z papera BERT, §3.1, a nie obowiązkowy zestaw dla każdego modelu.
Własny przykład różnicy: z sekwencji A B C można przygotować zadanie przewidzenia C po A B albo odtworzenia B z A [MASK] C. Oba sygnały pochodzą z dostępnego tekstu, ale wymagają innego przepływu informacji. Brak ręcznie przypisanej etykiety nie oznacza braku celu treningowego.
Co zostaje po treningu
Zapisany model przechowuje wyuczone parametry. Obejmują one m.in. tabelę Token Embedding, która w GPT jest uczona razem z resztą sieci. Kolejny etap, Fine-tuning, rozpoczyna pracę od już wyuczonych parametrów i dostosowuje model do określonego zastosowania.
Samo słowo „pre-trained” nie mówi jeszcze, na jakich danych model trenowano, co optymalizował ani jak dobrze wykona konkretne zadanie. Te informacje trzeba odczytać z opisu danego modelu.