El sobremuestreo aumenta artificialmente la cantidad de ejemplos disponibles de la clase minoritaria en un problema desbalanceado, ya sea duplicando ejemplos existentes al azar o generando ejemplos sintéticos nuevos (como hace SMOTE), buscando una proporción más equilibrada entre clases.
Cuándo se prefiere sobre el submuestreo
Es preferible cuando el conjunto de datos no es muy grande y no se puede permitir perder información descartando ejemplos de la clase mayoritaria, aunque generar demasiadas copias idénticas de la clase minoritaria (sin usar técnicas como SMOTE) puede llevar a que el modelo memorice esos casos específicos.
