Masked Language Modeling
Masked Language Modeling, w skrócie MLM, to zadanie uczenia, w którym model odtwarza wybrane tokeny po zaburzeniu tekstu wejściowego. Może przy tym korzystać z kontekstu zarówno przed przewidywaną pozycją, jak i po niej. To jeden z celów zastosowanych podczas Pre-training oryginalnego BERT.
W pracy o BERT, §3.1 autorzy wybierali losowo 15% pozycji tokenów WordPiece. Spośród wybranych pozycji 80% zastępowali symbolem [MASK], 10% losowym tokenem, a 10% pozostawiali bez zmiany. Te proporcje opisują konkretną recepturę BERT; samo pojęcie MLM nie wymaga właśnie takich wartości.
Co model ma odtworzyć
Własna ilustracja: mamy trzy umowne tokeny [A, B, C]. Po zmianie wejścia na [A, MASK, C] celem na środkowej pozycji nadal jest B. Model może użyć informacji z A i C. Gdy zamiast maski wstawimy losowy token D, poprawną odpowiedzią również pozostaje pierwotne B.
Składnik straty MLM, oparty na Cross-entropy, oblicza się dla wybranych pozycji względem ich oryginalnych tokenów. Obejmuje także te wybrane pozycje, których ostatecznie nie zmieniono. Appendix C.2 pracy porównuje różne proporcje zaburzeń; zabieg ogranicza różnicę między wejściami podczas pre-trainingu i późniejszych zadań bez [MASK].
Nie należy utożsamiać zaburzania tokenów z Causal Masking. Tam maska ogranicza dostęp attention do przyszłych pozycji. W MLM opisanym dla BERT dostęp do kontekstu po obu stronach jest częścią zadania. Oryginalny BERT miał ponadto osobny cel Next Sentence Prediction, więc MLM nie opisuje całego jego treningu.
Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.