Un modelo multimodal puede recibir y relacionar información de distintos tipos de entrada —por ejemplo, entender una imagen y responder preguntas sobre ella en texto— en lugar de estar limitado a un único tipo de dato, como ocurre con un modelo de lenguaje puramente textual.
Por qué es un paso natural
Las personas naturalmente combinamos información visual, auditiva y textual para entender el mundo. Entrenar modelos que puedan hacer lo mismo —relacionando, por ejemplo, la palabra “perro” con su apariencia visual y su sonido característico— permite aplicaciones más ricas y naturales, como describir imágenes o generar contenido a partir de instrucciones combinadas.
