Advertisement

强化学习中的Actor-Critic基础:基于时序差分的Actor-Critic方法

阅读量:

目录

一、算法说明

1.1 梯度表达式的一般形式

1.2 AC算法的结构体系

1.3 网络中的误差分析

1.4 原理示意图

二、程序实现部分

三、问题分析与探讨


一、算法描述与实现

1.1 广义梯度公式

通过上一章节对PG算法的阐述可知,针对策略梯度下降这一方法,我们的关注点在于:

因此,依据广义策略理论的框架,策略梯度可表示为:

athbf{si_{t}}

可表述为以下多种形式

1、

![](https://ad.itadn.com/c/weblog/blog-img/images/2025-05-31/JjhIEOb70rDzGi

全部评论 (0)

还没有任何评论哟~