李宏毅-强化学习笔记p6、Actor-Critic
发布时间
阅读量:
阅读量
一、policy gradient回顾

G代表在观察到状态st后执行动作at所获得的整体收益总和。该数值属于概率分布范畴,在不同回合中的变化可能会显著。当样本数量充足时此问题不大 但样本有限的情况下 模型可能会表现出较大的波动性 我们建议采用期望值作为替代 以减少采样的不确定性 即训练一个神经网络使其在输入状态s时 输出对应的预期奖励
二、Q_learning回顾

V是态势评估,Q是引导选择。
三、Actor-Critic

换句话说,在目前的研究中我们采用了通过两个网络来进行波动系数的计算的方法。其中Q参数用于表示当前选择的程度有
全部评论 (0)
还没有任何评论哟~
