El descenso de gradiente por mini-lotes calcula el gradiente promediando sobre un grupo pequeño de ejemplos (por ejemplo, 32 o 64) en cada paso de actualización, en lugar de usar un único ejemplo (más ruidoso pero más rápido) o el conjunto de datos completo (más preciso pero mucho más lento).
Por qué se volvió el enfoque estándar
Ofrece un buen equilibrio entre la velocidad de actualización del descenso estocástico puro y la estabilidad del descenso de gradiente completo, además de aprovechar mejor el paralelismo de hardware como las GPU, que procesan eficientemente varios ejemplos a la vez.
