En redes neuronales muy profundas, el gradiente calculado durante la retropropagación puede volverse cada vez más pequeño a medida que se propaga hacia las capas iniciales de la red, hasta el punto de que esas capas prácticamente dejan de actualizarse durante el entrenamiento.
Cómo se mitiga en la práctica
Técnicas como las conexiones residuales, funciones de activación como ReLU (en lugar de sigmoides, más propensas a este problema), y una buena inicialización de los pesos ayudan a que el gradiente se mantenga en un rango razonable incluso en redes con muchísimas capas.
