El envenenamiento de datos inserta ejemplos maliciosos, cuidadosamente diseñados, dentro del conjunto de datos con el que se entrena un modelo, buscando que aprenda un comportamiento incorrecto o una “puerta trasera” oculta que se activa solo ante una señal específica, sin afectar visiblemente su desempeño general.
Por qué es difícil de detectar
A diferencia de un ataque que ocurre en el momento de usar el modelo, el envenenamiento ocurre mucho antes, durante el entrenamiento, y sus efectos pueden permanecer completamente ocultos hasta que se activa la condición específica que el atacante diseñó, lo que hace que auditar la procedencia y calidad de los datos de entrenamiento sea una medida de seguridad clave.
