Antes de empezar a entrenar, los pesos de una red neuronal deben inicializarse con algún valor de partida. Una mala inicialización —por ejemplo, todos los pesos en cero, o valores demasiado grandes— puede hacer que el entrenamiento nunca despegue correctamente o sufra problemas de gradientes inestables desde el inicio.
Estrategias comunes
Métodos como la inicialización de He o de Xavier calculan los valores iniciales considerando el tamaño de cada capa, buscando que las señales que fluyen por la red mantengan una escala razonable tanto hacia adelante (predicciones) como hacia atrás (gradientes) desde las primeras iteraciones del entrenamiento.
