Masked Language Modeling
Chcesz uczyć model korzystania z całego zdania. Zakrywasz fragment w „Ala ma [MASK]” albo w „Ala [MASK] kota” i prosisz o odtworzenie oryginału. Informacje po obu stronach luki mogą być potrzebne do odpowiedzi.
Masked Language Modeling (MLM) to zadanie odtwarzania wybranych tokenów po zaburzeniu tekstu. Token jest kawałkiem tekstu. Model porównuje przewidywania w wybranych miejscach z oryginalnymi fragmentami i na tej podstawie zmienia swoje parametry.
W przykładzie [A, MASK, C] poprawną odpowiedzią na środku pozostaje B z oryginalnego [A, B, C]. Model może wykorzystać zarówno A, jak i C. Taką naukę zastosowano w BERT, z określonymi proporcjami maskowania i innych zmian.
To inne znaczenie „maskowania” niż Causal Masking, które blokuje dostęp do przyszłych pozycji. Receptura BERT nie jest obowiązkową recepturą każdego MLM, a samo odtwarzanie luk nie jest jeszcze regułą pisania całej odpowiedzi w czacie.
Mechanizm i szczegóły
W pracy o BERT, §3.1 autorzy wybierali losowo 15% pozycji tokenów WordPiece. Spośród wybranych pozycji 80% zastępowali symbolem [MASK], 10% losowym tokenem, a 10% pozostawiali bez zmiany. Te proporcje opisują konkretną recepturę BERT; samo pojęcie MLM nie wymaga właśnie takich wartości.
Co model ma odtworzyć
Własna ilustracja: mamy trzy umowne tokeny [A, B, C]. Po zmianie wejścia na [A, MASK, C] celem na środkowej pozycji nadal jest B. Model może użyć informacji z A i C. Gdy zamiast maski wstawimy losowy token D, poprawną odpowiedzią również pozostaje pierwotne B.
Składnik straty MLM, oparty na Cross-entropy, oblicza się dla wybranych pozycji względem ich oryginalnych tokenów. Obejmuje także te wybrane pozycje, których ostatecznie nie zmieniono. Appendix C.2 pracy porównuje różne proporcje zaburzeń; zabieg ogranicza różnicę między wejściami podczas pre-trainingu i późniejszych zadań bez [MASK].
Nie należy utożsamiać zaburzania tokenów z Causal Masking. Tam maska ogranicza dostęp attention do przyszłych pozycji. W MLM opisanym dla BERT dostęp do kontekstu po obu stronach jest częścią zadania. Oryginalny BERT miał ponadto osobny cel Next Sentence Prediction, więc MLM nie opisuje całego jego treningu.