La retropropagación calcula, para cada peso de una red neuronal, qué tanto contribuyó al error final de una predicción, propagando esa información desde la capa de salida hacia las capas anteriores. Ese cálculo es lo que le permite al descenso de gradiente saber en qué dirección ajustar cada peso.
Por qué fue un hito
Antes de popularizarse en los años 80, no existía una forma eficiente de entrenar redes con varias capas ocultas. La retropropagación hizo posible entrenar redes profundas de forma práctica, siendo el mecanismo que, décadas después, sigue sosteniendo el entrenamiento de los modelos de deep learning más grandes.
