En el aprendizaje por imitación, en lugar de que un agente descubra por sí solo, a través de prueba y error, cómo resolver una tarea, se le muestran demostraciones de un experto (humano u otro sistema) realizándola, y el agente aprende a reproducir ese comportamiento.
Cuándo es preferible al aprendizaje por refuerzo puro
Es especialmente útil cuando definir una función de recompensa clara para el aprendizaje por refuerzo sería muy difícil, o cuando explorar libremente el entorno por prueba y error sería costoso o riesgoso, como en la conducción autónoma o la robótica física.
