强化学习(五)Value Function Approximation
发布时间
阅读量:
阅读量
文章目录
- 参考文献
-
1. 逐步方法
-
- 1.1 梯度下降(Gradient Descent)
- 1.2 增量预测算法(Incremental Prediction Algorithm)
- 1.3 增量控制算法(Incremental Control Algorithm)
-
2. 批处理方法
-
- 2.1 最小二乘法预测(Least Squares)
- 2.2 经验回放随机梯度下降
- 2.1 DQN
-
Reference
[1] David Silver: https://youtu.be/UoPei5o4fps
在强化学习(四)中,我们探讨了在无模型环境下,如何通过MC与TD方法对策略进行评估与控制,并依据学习方式将其划分为On Policy与Off Policy两大类别,例如Sarsa与Q-Learning这两种基于表格的算法。
基于表格的算法在面对大规模强化学习问题时存在明显不足。由于需要存储所有状态-动作对对应的价值信息,这将导致计算资源与存储空间的极大消耗。

全部评论 (0)
还没有任何评论哟~
