Datapedia
Machine Learning

Overfitting

Cuando un modelo aprende el ruido de los datos de entrenamiento en vez del patrón general, y falla al generalizar sobre datos nuevos.

EntrenamientoValidaciónRegularización

¿Qué es?

El overfitting (o sobreajuste) ocurre cuando un modelo de machine learning se ajusta tan bien a los datos de entrenamiento que termina memorizando particularidades y ruido en lugar de aprender el patrón subyacente. El resultado es un modelo que rinde muy bien en los datos que ya vio, pero mal ante datos nuevos.

Es uno de los problemas más comunes al entrenar modelos, y suele aparecer cuando el modelo tiene demasiada capacidad (muchos parámetros) en relación con la cantidad y variedad de datos disponibles.

Cómo detectarlo

La señal más clara es una brecha creciente entre el error de entrenamiento y el error de validación: el primero sigue bajando mientras el segundo empieza a subir. Esa divergencia es la curva clásica que cualquier equipo de ML monitorea durante el entrenamiento.

Cómo mitigarlo

  • Más datos: cuantos más ejemplos representativos, más difícil es memorizar en vez de generalizar.
  • Regularización: técnicas como L1/L2, dropout o early stopping penalizan la complejidad excesiva del modelo.
  • Validación cruzada: separar los datos en múltiples particiones ayuda a detectar el problema antes de llevar el modelo a producción.
  • Simplificar el modelo: reducir la cantidad de parámetros cuando los datos disponibles no la justifican.

Ejemplo

Un modelo que predice precios de propiedades y logra un error casi nulo en el set de entrenamiento, pero se equivoca sistemáticamente con propiedades nuevas, probablemente memorizó características específicas de las casas que vio (como una dirección o un vendedor puntual) en vez de aprender relaciones generales entre superficie, ubicación y precio.