Advertisement

强化学习中Actor-Critic方法的公式推导与分析

阅读量:

本内容基于DQN及随机策略梯度方法展开阐述,相关公式出处可参考DQNstochastic policy gradient

一、AC算法

在先前的随机策略梯度算法中,我们可借鉴蒙特卡洛方法,通过采样单条轨迹来对策略实施更新,具体表达如下:
\nabla_{\theta}J(\theta)=\frac{1}{N}\sum_{i=0}^N\sum_{t=0}^T[\nabla_{\theta}\log \pi_{\theta}(a_{i,t}|s_{i,t})(\sum_{t'=t}^Tr(s_{i,t},a_{i,t})-b)] \qquad(1)
我们采用整条轨迹的回报来表征该序列的整体价值,这种估计方式具有无偏性。然而,在实际训练过程中,由于需要控制学习时长,往往难以完成足够多的交互采样。有限次的采样可能无法充分反映轨迹的真实期望值。每一次交互所得到的序列存在一定的差异性,对应的回报也存在波动性。因此,交互次数不足会显著增加轨迹回报的方差。这正是蒙特卡洛方法的一个缺点:虽然不存在偏差问题,但其方差较大。为了解决这一问题,在随机策略梯度算法中引入了基线b以降低方差。

Actor-Critic算法是一种通过引入一定偏差来减少方差的方法。其主要理念是借助一个独立模型来估算轨迹的累积回报,而非依赖于完整采样后的真实累积回报。此外,

全部评论 (0)

还没有任何评论哟~