Los guardrails son mecanismos —reglas explícitas, filtros, validaciones adicionales— que se colocan alrededor de un modelo de IA para evitar que genere contenido dañino, revele información sensible, o ejecute acciones no autorizadas, incluso si el propio modelo, dejado a su libre albedrío, podría hacerlo.
Dónde se aplican
Pueden actuar antes de que la entrada llegue al modelo (filtrando solicitudes problemáticas), o después de que el modelo genera una respuesta (revisando que no viole ciertas políticas), y son especialmente importantes en aplicaciones donde un agente de IA puede ejecutar acciones reales, no solo generar texto.
