Advertisement

强化学习(五)Value Function Approximation

阅读量:

文章目录

  • 参考文献
    • 1. 逐步方法

      • 1.1 梯度下降(Gradient Descent)
      • 1.2 增量预测算法(Incremental Prediction Algorithm)
      • 1.3 增量控制算法(Incremental Control Algorithm)
    • 2. 批处理方法

      • 2.1 最小二乘法预测(Least Squares)
      • 2.2 经验回放随机梯度下降
      • 2.1 DQN

Reference

[1] David Silver: https://youtu.be/UoPei5o4fps

在强化学习(四)中,我们探讨了在无模型环境下,如何通过MC与TD方法对策略进行评估与控制,并依据学习方式将其划分为On Policy与Off Policy两大类别,例如Sarsa与Q-Learning这两种基于表格的算法。
基于表格的算法在面对大规模强化学习问题时存在明显不足。由于需要存储所有状态-动作对对应的价值信息,这将导致计算资源与存储空间的极大消耗。

在这里插入图片描述

全部评论 (0)

还没有任何评论哟~