Datapedia
Inteligencia Artificial

Jailbreak (IA)

Técnica que busca eludir las restricciones de seguridad de un modelo de IA, mediante prompts diseñados para hacer que genere contenido que normalmente rechazaría producir.

Seguridad de IALLM

Un jailbreak intenta engañar a un modelo de lenguaje para que ignore sus propias restricciones de seguridad, muchas veces mediante formulaciones indirectas, juegos de rol o instrucciones diseñadas cuidadosamente para confundir sus mecanismos de filtrado de contenido.

Por qué es una carrera constante

A medida que se descubren y publican nuevas técnicas de jailbreak, los desarrolladores de modelos ajustan sus sistemas de seguridad para prevenirlas, en un ciclo continuo similar al de la ciberseguridad tradicional entre atacantes y defensores.