Maskierte Sprachmodellierung
Du möchtest ein Modell trainieren, das gesamte Satzumfeld zu nutzen. Du verdeckst ein Fragment in „Ala hat [MASK]“ oder „Ala [MASK] eine Katze“ und bittest um die Wiederherstellung des Originals. Informationen auf beiden Seiten der Lücke können für die Antwort benötigt werden.
Masked Language Modeling (MLM) ist die Aufgabe, ausgewählte Tokens nach einer Veränderung des Textes wiederherzustellen. Ein Token ist ein Textstück. Das Modell vergleicht die Vorhersagen an den ausgewählten Stellen mit den ursprünglichen Fragmenten und verändert daraufhin seine Parameter.
Im Beispiel [A, MASK, C] bleibt die richtige Antwort in der Mitte B aus dem ursprünglichen [A, B, C]. Das Modell kann sowohl A als auch C verwenden. Dieses Lernen wurde in BERT mit festgelegten Anteilen der Maskierung und anderer Änderungen eingesetzt.
Das ist eine andere Bedeutung von „Maskierung“ als bei Causal Masking, das den Zugriff auf spätere Positionen blockiert. Das Rezept von BERT ist kein verpflichtendes Rezept für jedes MLM, und allein das Wiederherstellen von Lücken ist noch keine Regel zum Schreiben einer gesamten Chatantwort.
Mechanismus und Details
In der BERT-Arbeit, §3.1 wählten die Autoren zufällig 15% der WordPiece-Tokenpositionen aus. Von den ausgewählten Positionen ersetzten sie 80% durch [MASK], 10% durch ein zufälliges Token und ließen 10% unverändert. Diese Anteile beschreiben die konkrete BERT-Rezeptur; der Begriff MLM verlangt nicht genau diese Werte.
Was das Modell rekonstruieren soll
Eigene Illustration: Wir haben drei angenommene Tokens [A, B, C]. Nach der Änderung der Eingabe zu [A, MASK, C] bleibt das Ziel an der mittleren Position B. Das Modell kann Informationen aus A und C nutzen. Setzen wir statt der Maske ein zufälliges Token D ein, bleibt die korrekte Antwort ebenfalls das ursprüngliche B.
Der MLM-Verlustterm, basierend auf Cross-entropy, wird für die ausgewählten Positionen gegenüber ihren ursprünglichen Tokens berechnet. Er umfasst auch ausgewählte Positionen, die letztlich unverändert blieben. Appendix C.2 der Arbeit vergleicht unterschiedliche Anteile der Störungen; das Verfahren verringert den Unterschied zwischen den Eingaben beim Pre-training und bei späteren Aufgaben ohne [MASK].
Die Störung von Tokens darf nicht mit kausaler Maskierung gleichgesetzt werden. Dort begrenzt die Maske den Attention-Zugriff auf zukünftige Positionen. Beim für BERT beschriebenen MLM gehört der Zugriff auf beidseitigen Kontext zur Aufgabe. Das ursprüngliche BERT hatte außerdem ein separates Ziel, Next Sentence Prediction. MLM beschreibt daher nicht sein gesamtes Training.