2021-01-11 MDP
发布时间
阅读量:
阅读量
强化学习MDP四元组 <S,A,P,R>
s:state 状态
a:action 动作
r:reward 奖励
p:probability 状态转移概率



在st时刻选择了at动作时,转移到st+1,而且拿到rt的概率
该系统遵循马尔可夫特性,在任何时间步的状态转移仅受其前一个时刻的状态影响,并不受前两个时间步的状态(即st-1、st-2)的影响
此过程也取决于智能体与环境交互的at(包含一个决策机制) ---> 马尔可夫决策过程
状图转移与序列决策
全部评论 (0)
还没有任何评论哟~
