En lugar de aprender únicamente patrones generales, un modelo puede llegar a memorizar fragmentos específicos y detallados de sus datos de entrenamiento, y reproducirlos casi textualmente ante ciertas consultas, incluso si esos datos contenían información personal o confidencial.
Por qué es una preocupación de privacidad real
Si un modelo se entrenó con datos que incluían información sensible sin la debida anonimización, existe el riesgo de que esa información pueda ser recuperada mediante consultas específicas, lo que convirtió a la memorización en un tema central en la evaluación de privacidad de los modelos de lenguaje modernos.
