Datapedia
Machine Learning

Problema del gradiente que se desvanece

Dificultad de entrenamiento en redes neuronales profundas, donde el gradiente se vuelve extremadamente pequeño al propagarse hacia las primeras capas, impidiendo que aprendan de forma efectiva.

EntrenamientoRedes neuronales

En redes neuronales muy profundas, el gradiente calculado durante la retropropagación puede volverse cada vez más pequeño a medida que se propaga hacia las capas iniciales de la red, hasta el punto de que esas capas prácticamente dejan de actualizarse durante el entrenamiento.

Cómo se mitiga en la práctica

Técnicas como las conexiones residuales, funciones de activación como ReLU (en lugar de sigmoides, más propensas a este problema), y una buena inicialización de los pesos ayudan a que el gradiente se mantenga en un rango razonable incluso en redes con muchísimas capas.