El model serving se encarga de poner un modelo entrenado a disposición de otras aplicaciones, típicamente a través de una API, gestionando aspectos como la latencia de respuesta, la capacidad de manejar muchas solicitudes simultáneas, y la actualización del modelo sin interrumpir el servicio.
Por qué es un desafío de ingeniería distinto al entrenamiento
Entrenar un modelo es, en gran medida, un proceso que ocurre una vez (o periódicamente); servirlo en producción implica garantizar disponibilidad constante, baja latencia y capacidad de escalar ante picos de demanda, retos más cercanos a la ingeniería de software tradicional que al entrenamiento del modelo en sí.
