强化学习第6章——策略梯度
发布时间
阅读量:
阅读量
文章目录
- 参考文献
-
1. 引言
-
-
1.1 基于价值的方法与基于策略的方法
-
1.2 策略梯度方法
- 1.2.1 策略目标函数
- 1.2.2 策略优化过程
- 1.2.3 梯度下降算法
- 1.2.4 分数函数
-
1.3 单步马尔可夫决策过程
-
1.4 多步马尔可夫决策过程
-
-
2. 蒙特卡洛策略梯度方法
-
- 2.1 REINFORCE算法
-
3. 演员评论家策略梯度方法
-
-
3.1 QAC(动作价值演员评论家)
-
3.2 A2C(优势演员评论家)
- 3.2.1 基线技术
- 3.2.2 优势函数
- 3.2.3 对优势函数的估计
-
3.3 总结
-
-
4. 补充材料
- 4.1 演员、环境与奖励机制
- 4.2 最大化预期奖励值
-
Reference
[1] David Silver: https://www.youtube.com/watch?v=KHZVXao4qXs&t=4609s
1. Introduction
1.1 Value-Based and Policy-Based
定义
在强化学
全部评论 (0)
还没有任何评论哟~
