El self-attention permite que cada palabra de una oración “mire” a todas las demás palabras de esa misma oración para decidir cómo interpretarse, capturando relaciones de significado como a qué sustantivo se refiere un pronombre, sin importar qué tan lejos esté en el texto.
Su rol en el Transformer
Es el componente central del Transformer: al calcular self-attention en paralelo para todos los elementos de una secuencia, el modelo puede procesar oraciones completas de una vez, en lugar de palabra por palabra en orden secuencial, lo que aceleró enormemente el entrenamiento de modelos de lenguaje grandes.
