强化学习中的Actor-Critic基础:基于时序差分的Actor-Critic方法
发布时间
阅读量:
阅读量
目录
一、算法说明
1.1 梯度表达式的一般形式
1.2 AC算法的结构体系
1.3 网络中的误差分析
1.4 原理示意图
二、程序实现部分
三、问题分析与探讨
一、算法描述与实现
1.1 广义梯度公式
通过上一章节对PG算法的阐述可知,针对策略梯度下降这一方法,我们的关注点在于:

因此,依据广义策略理论的框架,策略梯度可表示为:


可表述为以下多种形式
1、

还没有任何评论哟~
