Datapedia
Machine Learning

Proceso de decisión de Markov (MDP)

Marco matemático que formaliza problemas de toma de decisiones secuenciales, donde cada acción afecta tanto una recompensa inmediata como el estado futuro del sistema.

Aprendizaje por refuerzoModelos probabilísticos

Un proceso de decisión de Markov formaliza un problema donde un agente, en cada estado posible, elige una acción que le otorga una recompensa inmediata y lo lleva a un nuevo estado, asumiendo que las probabilidades de transición entre estados dependen solo del estado y la acción actuales.

Su rol como base del aprendizaje por refuerzo

Es el marco matemático formal sobre el cual se construye prácticamente toda la teoría del aprendizaje por refuerzo: algoritmos como Q-learning buscan, en esencia, encontrar la estrategia óptima de decisiones dentro de un proceso de decisión de Markov.