Datapedia
Inteligencia Artificial

Self-attention

Variante del mecanismo de atención en la que cada elemento de una secuencia se relaciona con todos los demás elementos de esa misma secuencia.

TransformerDeep Learning

El self-attention permite que cada palabra de una oración “mire” a todas las demás palabras de esa misma oración para decidir cómo interpretarse, capturando relaciones de significado como a qué sustantivo se refiere un pronombre, sin importar qué tan lejos esté en el texto.

Su rol en el Transformer

Es el componente central del Transformer: al calcular self-attention en paralelo para todos los elementos de una secuencia, el modelo puede procesar oraciones completas de una vez, en lugar de palabra por palabra en orden secuencial, lo que aceleró enormemente el entrenamiento de modelos de lenguaje grandes.