Advertisement

强化学习笔记(李宏毅)PPO p1-p2

阅读量:

一、policy gradient回顾

最关键之处在于,加权求和的本质即为期望值的体现

在这里插入图片描述

PPO作为policy gradient方法的优化版本,首先需要回顾policy gradient的基本概念,并介绍两个关键要点。policy gradient的理论基础在于:当前我们拥有N组数据,利用这些数据对智能体即π-function进行参数优化。其中每组数据的结构形式为:
τ= {s1, a1,r1, s2, a2,r2,…,sT,aT,rT}

通过计算奖励函数的梯度,可以得出用于更新智能体参数的具体步长表达式如下:

在这里插入图片描述

换句话说,每一次行为都会对参数的调整产生影响,但其中存在一些不合理的现象,因此引入了以下改进措施:

改进1:在相同的state/scenario下,agent可以执行多种不同的action。然而由于数据量有限,我

全部评论 (0)

还没有任何评论哟~