Un modelo de lenguaje enmascarado se entrena ocultando aleatoriamente algunas palabras de un texto y pidiéndole al modelo que las adivine, usando como pista tanto las palabras anteriores como las posteriores a la palabra oculta. BERT es el ejemplo más conocido de este enfoque.
Su diferencia con un modelo autorregresivo
Mientras que un modelo de lenguaje enmascarado ve el contexto completo (antes y después) para predecir una palabra oculta, un modelo autorregresivo como GPT solo puede ver las palabras anteriores al generar cada nueva palabra, lo que lo hace más adecuado para generar texto de forma secuencial y natural.
