Modelado del lenguaje enmascarado
Quieres enseñar al modelo a usar toda la frase. Ocultas un fragmento de «Ana tiene [MASK]» o de «Ana [MASK] un gato» y le pides que reconstruya el original. La información a ambos lados del hueco puede ser necesaria para responder.
Masked Language Modeling (MLM) es la tarea de reconstruir tokens seleccionados después de alterar el texto. Un token es un fragmento de texto. El modelo compara las predicciones en los lugares elegidos con los fragmentos originales y modifica sus parámetros a partir de esa comparación.
En el ejemplo [A, MASK, C], la respuesta correcta en el centro sigue siendo B, del original [A, B, C]. El modelo puede aprovechar tanto A como C. BERT utilizó este aprendizaje con proporciones específicas de enmascaramiento y otras alteraciones.
Es un significado de «enmascaramiento» distinto al de Causal Masking, que bloquea el acceso a posiciones futuras. La receta de BERT no es obligatoria para todo MLM, y reconstruir huecos no constituye por sí solo una regla para escribir una respuesta completa en un chat.
Mecanismo y detalles
En el trabajo sobre BERT, §3.1, los autores elegían aleatoriamente el 15% de las posiciones de tokens WordPiece. De las posiciones seleccionadas, sustituían el 80% por el símbolo [MASK], el 10% por un token aleatorio y dejaban el 10% sin cambios. Estas proporciones describen la receta concreta de BERT; el concepto de MLM por sí solo no exige esos valores.
Qué debe reconstruir el modelo
Ilustración propia: tenemos tres tokens convencionales [A, B, C]. Tras cambiar la entrada a [A, MASK, C], el objetivo de la posición central sigue siendo B. El modelo puede utilizar la información de A y C. Si, en lugar de una máscara, introducimos un token aleatorio D, la respuesta correcta también sigue siendo el B original.
El componente de pérdida de MLM, basado en Cross-entropy, se calcula para las posiciones seleccionadas respecto a sus tokens originales. También incluye las posiciones seleccionadas que finalmente no se alteraron. El Appendix C.2 del trabajo compara distintas proporciones de alteraciones; la técnica reduce la diferencia entre las entradas durante el preentrenamiento y las tareas posteriores sin [MASK].
No debe confundirse la perturbación de tokens con el enmascaramiento causal. En este último, la máscara limita el acceso de la atención a posiciones futuras. En el MLM descrito para BERT, el acceso al contexto de ambos lados forma parte de la tarea. Además, el BERT original tenía un objetivo separado de Next Sentence Prediction, así que MLM no describe todo su entrenamiento.