Advertisement

David Silver 强化学习 Lecture 2 MDP

阅读量:

David Silver 关于强化学习的系列博客内容,源自其相关的PPT资料以及知乎平台上叶强所开设的强化学习专栏。

1 Markov Processes

1.1 Introduction to MDPs

强化学习领域中,马尔科夫决策过程被用于刻画完全可观测的环境,此时所有相关信息均被完整呈现给智能体,使其能够掌握全部信息。几乎所有的强化学习问题均可被抽象为马尔科夫决策过程的形式。

1.2 Markov Property

当某一状态S_t满足马尔科夫性质时,其对应的概率关系可表示为:P[S_{t+1}|S_t]=P[S_{t+1}|S_1,...,S_t]。在时序过程的分析中,若t+1时刻的状态仅由t时刻的状态所决定,而不受此前任意时刻状态的影响,则称该时刻的状态具备马尔科夫性(Markov property)。若序列中的所有状态均符合这一特性,则整个过程被认为具有马尔科夫性。具备该特性的随机过程被定义为马尔科夫过程(Markov process),也被称为马尔科夫链(Markov chain)。在这一过程中,每个状态都包含了与过程发展相关的历史信息,但一旦当前状态被确定下来,历史状态信息S_1... S_{t−1}对于预测t+1时刻的状态将不再具有任何影响,可以忽略不计。

State Transition M

全部评论 (0)

还没有任何评论哟~