En lugar de calcular el gradiente exacto usando todos los datos de entrenamiento disponibles en cada paso (lo cual sería muy costoso con conjuntos de datos grandes), el descenso de gradiente estocástico (SGD) estima ese gradiente usando solo un ejemplo, o un pequeño grupo de ejemplos, en cada actualización.
El compromiso que implica
Esta estimación es más ruidosa que el gradiente calculado sobre todos los datos, pero permite hacer muchas más actualizaciones en el mismo tiempo, y ese ruido adicional en la práctica puede incluso ayudar al modelo a escapar de mínimos locales poco óptimos en la función de pérdida.
