Datapedia
Inteligencia Artificial

Inyección de prompts (Prompt injection)

Técnica de ataque que manipula las instrucciones de un sistema basado en IA insertando texto malicioso, para que ignore sus instrucciones originales o revele información no autorizada.

Seguridad de IALLM

La inyección de prompts oculta instrucciones maliciosas dentro de un contenido que un modelo de lenguaje procesará —un documento, una página web, un correo— con la intención de que el modelo termine siguiendo esas instrucciones ocultas en lugar de (o además de) las instrucciones legítimas de la aplicación.

Por qué es especialmente riesgosa en agentes de IA

Cuando un agente de IA puede ejecutar acciones reales (enviar correos, hacer compras, modificar archivos), una inyección de prompts exitosa puede traducirse en acciones dañinas concretas, no solo en una respuesta de texto incorrecta, lo que la convierte en una de las principales preocupaciones de seguridad al diseñar agentes autónomos.