Datapedia
Inteligencia Artificial

Modelo multimodal

Modelo de IA capaz de procesar y combinar distintos tipos de datos, como texto, imágenes, audio o video, dentro de un mismo sistema.

IA generativaVisión por computadora

Un modelo multimodal puede recibir y relacionar información de distintos tipos de entrada —por ejemplo, entender una imagen y responder preguntas sobre ella en texto— en lugar de estar limitado a un único tipo de dato, como ocurre con un modelo de lenguaje puramente textual.

Por qué es un paso natural

Las personas naturalmente combinamos información visual, auditiva y textual para entender el mundo. Entrenar modelos que puedan hacer lo mismo —relacionando, por ejemplo, la palabra “perro” con su apariencia visual y su sonido característico— permite aplicaciones más ricas y naturales, como describir imágenes o generar contenido a partir de instrucciones combinadas.