Also known as: Markov decision process (MDP) · MDP
Markov Decision Process (MDP), или марковский процесс принятия решений, — математическая основа для моделирования последовательного принятия решений, где исходы частично случайны и частично контролируются действиями агента. Он представляет состояния, действия, переходы и награды при условии марковского свойства. MDP являются центральными для обучения с подкреплением, динамического программирования и стохастического управления.
A discrete time stochastic control process. It provides a mathematical framework for modeling decision making in situations where outcomes are partly random and partly under the control of a decision maker. MDPs are useful for studying optimization problems solved via dynamic programming and reinforcement learning.
A graph representing the decision-making model where decisions (or actions) are taken to navigate a sequence of states under the assumption that the Markov property holds. In reinforcement learning, these transitions between states return a numerical reward.