Datapedia
Inteligencia Artificial

Transformer

Arquitectura de red neuronal basada en mecanismos de atención, que es la base de los modelos de lenguaje modernos.

LLMsAtenciónArquitectura

Qué es

El Transformer es una arquitectura de red neuronal presentada en 2017 que reemplazó a los modelos secuenciales anteriores (como las RNN) para procesar texto y otros datos ordenados. Su pieza central es el mecanismo de atención, que le permite a cada elemento de una secuencia ponderar la importancia de todos los demás elementos, sin importar qué tan lejos estén.

Por qué cambió todo

Antes del Transformer, procesar una oración palabra por palabra en orden hacía muy lento el entrenamiento y dificultaba capturar relaciones entre palabras distantes. La atención permite procesar toda la secuencia en paralelo y relacionar directamente cualquier par de palabras, lo que mejoró enormemente la calidad y la velocidad de entrenamiento.

Dónde se usa

Es la arquitectura detrás de los modelos de lenguaje (como los que impulsan los asistentes conversacionales), de sistemas de traducción automática y, con adaptaciones, también de modelos de visión por computadora.