Datapedia
Machine Learning

Validación cruzada

Técnica que evalúa el rendimiento de un modelo dividiendo los datos en varias particiones, entrenando y probando el modelo múltiples veces para obtener una estimación más confiable.

Evaluación de modelosOverfittingTrain/test split

Qué es

En vez de dividir los datos una sola vez en entrenamiento y prueba, la validación cruzada divide el conjunto de datos en varias partes (folds). El modelo se entrena varias veces, usando en cada ronda una parte distinta como conjunto de prueba y el resto como entrenamiento, y luego se promedian los resultados de todas las rondas.

Por qué es más confiable que una sola división

Una única división en train/test puede dar una estimación optimista o pesimista solo por casualidad, dependiendo de qué datos quedaron en cada lado. Repetir el proceso varias veces con distintas divisiones da una imagen mucho más estable y confiable del verdadero rendimiento del modelo.

La variante más común

La validación cruzada de K particiones (K-fold) es la más usada: típicamente se divide el conjunto de datos en 5 o 10 partes iguales, rotando cuál de ellas se usa como prueba en cada ronda de entrenamiento.