La fuga de datos ocurre cuando información que el modelo no debería tener disponible en el momento de predecir —ya sea del conjunto de prueba, o simplemente del futuro respecto al momento de la predicción real— termina filtrándose de alguna forma hacia el proceso de entrenamiento, haciendo que el modelo parezca funcionar mucho mejor de lo que realmente lo haría en producción.
Un ejemplo clásico
Incluir en las variables de entrada una columna que en la práctica solo se conocería después de que ocurriera el evento que se quiere predecir (como usar la fecha de cierre de un préstamo para predecir si será aprobado) produce un modelo que parece funcionar perfectamente en pruebas, pero que fallaría por completo al usarse en un escenario real donde ese dato todavía no existe.
