La inyección de prompts oculta instrucciones maliciosas dentro de un contenido que un modelo de lenguaje procesará —un documento, una página web, un correo— con la intención de que el modelo termine siguiendo esas instrucciones ocultas en lugar de (o además de) las instrucciones legítimas de la aplicación.
Por qué es especialmente riesgosa en agentes de IA
Cuando un agente de IA puede ejecutar acciones reales (enviar correos, hacer compras, modificar archivos), una inyección de prompts exitosa puede traducirse en acciones dañinas concretas, no solo en una respuesta de texto incorrecta, lo que la convierte en una de las principales preocupaciones de seguridad al diseñar agentes autónomos.
