Advertisement

强化学习第6章——策略梯度

阅读量:

文章目录

  • 参考文献
    • 1. 引言

      • 1.1 基于价值的方法与基于策略的方法

      • 1.2 策略梯度方法

        • 1.2.1 策略目标函数
        • 1.2.2 策略优化过程
        • 1.2.3 梯度下降算法
        • 1.2.4 分数函数
      • 1.3 单步马尔可夫决策过程

      • 1.4 多步马尔可夫决策过程

    • 2. 蒙特卡洛策略梯度方法

      • 2.1 REINFORCE算法
    • 3. 演员评论家策略梯度方法

      • 3.1 QAC(动作价值演员评论家)

      • 3.2 A2C(优势演员评论家)

        • 3.2.1 基线技术
        • 3.2.2 优势函数
        • 3.2.3 对优势函数的估计
      • 3.3 总结

    • 4. 补充材料

      • 4.1 演员、环境与奖励机制
      • 4.2 最大化预期奖励值

Reference

[1] David Silver: https://www.youtube.com/watch?v=KHZVXao4qXs&t=4609s

1. Introduction

1.1 Value-Based and Policy-Based

定义
在强化学

全部评论 (0)

还没有任何评论哟~