La poda elimina ramas de un árbol de decisión que se generaron a partir de patrones muy específicos y poco generalizables de los datos de entrenamiento, simplificando el árbol resultante a cambio de una capacidad de generalización mejor sobre datos nuevos.
Sus dos enfoques principales
La poda previa detiene el crecimiento del árbol antes de que se vuelva demasiado complejo, según ciertos criterios definidos de antemano; la poda posterior deja crecer el árbol completo primero, y luego elimina las ramas menos útiles evaluando su impacto real en el desempeño sobre datos de validación.
