Advertisement

2021-01-11 MDP

阅读量:

强化学习MDP四元组 <S,A,P,R>

s:state 状态

a:action 动作

r:reward 奖励

p:probability 状态转移概率

p

在st时刻选择了at动作时,转移到st+1,而且拿到rt的概率

该系统遵循马尔可夫特性,在任何时间步的状态转移仅受其前一个时刻的状态影响,并不受前两个时间步的状态(即st-1、st-2)的影响

此过程也取决于智能体与环境交互的at(包含一个决策机制) ---> 马尔可夫决策过程

状图转移与序列决策

![](https://ad.itadn.com/c/we

全部评论 (0)

还没有任何评论哟~