Datapedia
Machine Learning

Random Forest

Algoritmo de machine learning que combina las predicciones de muchos árboles de decisión entrenados de forma ligeramente distinta, para mejorar la precisión y reducir el overfitting.

EnsambleÁrboles de decisiónClasificación

Qué es

Random Forest entrena muchos árboles de decisión distintos, cada uno sobre una muestra ligeramente diferente de los datos y de las variables disponibles, y combina sus predicciones (por votación en clasificación, o promedio en regresión) para llegar a un resultado final más robusto que el de un solo árbol.

Por qué funciona mejor que un solo árbol

Un árbol individual es propenso a memorizar particularidades de los datos de entrenamiento. Al promediar las predicciones de muchos árboles distintos y algo aleatorios entre sí, los errores individuales tienden a compensarse, reduciendo el overfitting sin perder la capacidad de capturar relaciones complejas.

Cuándo se usa

Es una opción muy sólida como punto de partida en problemas de clasificación y regresión con datos tabulares, porque suele dar buenos resultados sin necesitar un ajuste de hiperparámetros demasiado fino.