Advertisement

强化学习中Deterministic Policy Gradient与Stochastic Policy Gradient有何不同

阅读量:

确定性策略梯度(DPG)
随机策略梯度(SPG)
DPG可视为当SPG中策略的概率分布方差逐渐减小至零时所形成的极限情况。
策略梯度的核心理念在于,依据目标函数增长的方向对策略参数进行相应的调整。

  • SPG
    策略被定义为一种将状态映射至动作概率分布的函数关系。
这里写图片描述

基于此,对性能目标的界定如下,其包含两个积分项,其中一项为针对策略空间的积分运算。

这里写图片描述

SPG的梯度表达式如下所示:

这里写图片描述

从上述图表中可以观察到,SPG在实施过程中需综合考量状态概率分布与动作概率分布两个维度,因此若要开展学习训练,必须确保有足够的样本数量以全面覆盖二维状态-动作空间。

全部评论 (0)

还没有任何评论哟~