强化学习笔记(李宏毅)PPO p1-p2
发布时间
阅读量:
阅读量
一、policy gradient回顾
最关键之处在于,加权求和的本质即为期望值的体现 :

PPO作为policy gradient方法的优化版本,首先需要回顾policy gradient的基本概念,并介绍两个关键要点。policy gradient的理论基础在于:当前我们拥有N组数据,利用这些数据对智能体即π-function进行参数优化。其中每组数据的结构形式为:
τ= {s1, a1,r1, s2, a2,r2,…,sT,aT,rT}
通过计算奖励函数的梯度,可以得出用于更新智能体参数的具体步长表达式如下:

换句话说,每一次行为都会对参数的调整产生影响,但其中存在一些不合理的现象,因此引入了以下改进措施:
改进1:在相同的state/scenario下,agent可以执行多种不同的action。然而由于数据量有限,我
全部评论 (0)
还没有任何评论哟~
