Durante el entrenamiento, dropout apaga aleatoriamente un porcentaje de las neuronas de una capa en cada paso, forzando a la red a no depender excesivamente de ninguna neurona específica y a aprender representaciones más robustas y redundantes de la información.
Por qué es tan efectivo contra el overfitting
Evita que la red memorice patrones muy específicos de los datos de entrenamiento que dependan de combinaciones particulares de neuronas, funcionando de forma similar a entrenar muchas redes ligeramente distintas de manera simultánea y luego combinarlas.
