深入理解强化学习中的公式
发布时间
阅读量:
阅读量
观看完相关视频后,意识到对于强化学习的认知仍停留在较为浅显的层面,诸多疑问尚未厘清,因此决定暂停进度,系统梳理相关公式,以进一步提升对理论内容的理解深度,为后续学习奠定基础。
第三章
Return
在某次实验过程中,时间步t之后所获得的奖励依次表示为Rt+1, Rt+2, Rt+3, . . .,
片段奖励Gt := Rt+1 + Rt+2 + Rt+3 +· · ·+ RT,如公式(3.1)所示:
此处最后一个状态是否必然属于终结状态,目前尚无法确定。然而,在实际问题处理中,我认为这并非关键问题。总而言之,此处对一个片段(episode)的总奖励进行了定义。
非终结状态:S
终结状态: S+
引入折扣因子后的表达形式为:

MDP
具备马尔科夫特性的强化学习问题被定义为马尔科夫决策过程(Markov Decision Process)。尤其值得注意的是,当状态集合与动作集合均为有限集时,此类过程被称为有限马尔科夫过程(finite Markov process),亦即有限MDP。有限MDP在强化学
全部评论 (0)
还没有任何评论哟~
