En una arquitectura Mixture of Experts, el modelo está compuesto por muchos subcomponentes especializados llamados “expertos”, pero para cada entrada específica solo se activan unos pocos de ellos, en lugar de todo el modelo completo, mediante un mecanismo que decide cuáles son los más relevantes en cada caso.
Su ventaja principal
Permite construir modelos con una cantidad enorme de parámetros totales, sin que el costo computacional de procesar cada entrada crezca en la misma proporción, ya que solo una fracción del modelo se activa en cada momento, logrando un buen equilibrio entre capacidad y eficiencia.
