La latencia de cola mide el tiempo de respuesta de las solicitudes más lentas de un sistema, típicamente expresado como el percentil 95 o 99 (el tiempo que el 95% o 99% de las solicitudes no supera), en lugar de simplemente el tiempo de respuesta promedio, que puede ocultar por completo la existencia de una fracción de solicitudes con una experiencia mucho peor.
Por qué el promedio puede ser engañoso
Un sistema puede tener un promedio de respuesta excelente y aun así frustrar a una parte significativa de sus usuarios si esas solicitudes lentas ocurren con suficiente frecuencia; a mayor escala de tráfico, incluso una latencia de cola aparentemente rara termina afectando a un número absoluto considerable de usuarios reales.
