Datapedia
Inteligencia Artificial

Costo de inferencia

Recursos computacionales y económicos necesarios para ejecutar un modelo de IA ya entrenado y generar una respuesta a partir de una entrada nueva.

EficienciaLLM

El costo de inferencia se refiere a cuánto cuesta, en tiempo y en recursos computacionales, usar un modelo ya entrenado para producir una respuesta ante una nueva entrada, a diferencia del costo de entrenamiento, que es el gasto (mucho mayor) de crear el modelo desde cero.

Por qué se volvió una preocupación central

A medida que los modelos se usan a gran escala —millones de consultas diarias en un producto popular— el costo acumulado de inferencia puede superar ampliamente al costo original de entrenamiento, lo que impulsó el desarrollo de técnicas como la cuantización y la destilación para hacer los modelos más eficientes de ejecutar.