深度学习10-策略驱动:一种替代方案
发布时间
阅读量:
阅读量
策略梯度:一种替代方法
▪ 与已掌握的Q-learning方法进行比较,阐述该方法的初衷、优点及不足之处。
▪ 从一种名为REINFORCE的基础策略梯度算法出发,尝试将其应用于CartPole环境,并与深度Q网络(DQN)方法进行对比。
即使基于非常简单的假设,交叉熵方法依然能够有效运行,但相较于仅使用0和1进行训练,采用Q(s,a)的方式可显著提升效果。这主要得益于更细致的状态转移划分。例如,在总奖励为10的状态转移片段中,其对梯度的贡献应高于奖励为1的片段。此外,使用Q(s,a)而非固定值0或1的另一个优势在于:可以提高片段初始阶段优质动作的概率,并降低接近片段结束时的动作影响(由于Q(s,a)中包含折扣因子,因此能自动考虑较长动作序列带来的不确定性)。这正是REINFORCE方法的核心理念。具体步骤如下:
1)采用随机权重初始化网络。
2)执行N个完整的片段操作,并记录其(s,a,r,s')状态转移信息。
3)针对每个片段k中的每一步t,计算后续步骤所获得的折扣后总奖励:。
4)计算所有状态转移对应的损失函数:。
5)通过SGD优化算法更新权重参数以最小化损失值。
6)重复从第2步开始的操作直至算法收敛。
上述算法在多个关键方面区别于Q-learning:
▪ 不需要显式地进行探索机制设计。在Q-learning
全部评论 (0)
还没有任何评论哟~
