Un proceso de decisión de Markov formaliza un problema donde un agente, en cada estado posible, elige una acción que le otorga una recompensa inmediata y lo lleva a un nuevo estado, asumiendo que las probabilidades de transición entre estados dependen solo del estado y la acción actuales.
Su rol como base del aprendizaje por refuerzo
Es el marco matemático formal sobre el cual se construye prácticamente toda la teoría del aprendizaje por refuerzo: algoritmos como Q-learning buscan, en esencia, encontrar la estrategia óptima de decisiones dentro de un proceso de decisión de Markov.
