Estos sistemas reciben una descripción en texto —“un gato astronauta en la luna, estilo acuarela”— y generan una imagen original que intenta representar visualmente esa descripción, típicamente usando modelos de difusión entrenados sobre enormes colecciones de pares imagen-texto.
Cómo relacionan texto e imagen
Suelen apoyarse en un modelo que aprendió a relacionar descripciones textuales con contenido visual (mediante aprendizaje contrastivo), guiando así el proceso de generación de la imagen para que se ajuste cada vez más a lo descrito en el texto de entrada.
