El problema del bandit multi-armado (llamado así por analogía con máquinas tragamonedas de distintos brazos) representa una situación donde hay que elegir repetidamente entre varias opciones con resultados inciertos, balanceando la necesidad de explorar opciones nuevas para aprender más sobre ellas, con la de explotar la opción que hasta el momento parece ser la mejor.
Su ventaja frente a un test A/B tradicional
A diferencia de un test A/B clásico, que divide el tráfico de forma fija entre opciones durante todo el experimento, un enfoque de bandit ajusta dinámicamente esa asignación a medida que aprende cuál opción funciona mejor, reduciendo el costo de mostrar opciones peores a más usuarios de los estrictamente necesarios para aprender.
