En la destilación de conocimiento, un modelo pequeño (“alumno”) se entrena para reproducir las predicciones de un modelo grande ya entrenado (“maestro”), en lugar de aprender directamente de los datos originales etiquetados. El modelo alumno aprovecha así el conocimiento ya “condensado” del modelo grande.
Por qué es útil
Los modelos grandes suelen ser más precisos, pero también más lentos y costosos de ejecutar. La destilación permite obtener un modelo mucho más liviano y rápido, adecuado para ejecutarse en dispositivos con recursos limitados, conservando buena parte del desempeño del modelo original.
