强化学习常见算法对比
发布时间
阅读量:
阅读量
目录
- 动态规划
- 蒙特卡洛方法
- 时间差分学习
- 多步引导技术
- 深度Q网络
-
- 研究背景
- 优化方案
Dynamic Programming
- 思路:
通过Bellman方程进行迭代运算,每轮迭代中,基于所有状态s在第k次迭代所得的vk(s’)值,计算出第k+1次迭代对应的vk+1(s)数值。借助这一过程的持续循环,最终可使结果趋于收敛,达到最优解v∗(s)。
Bellman方程:

- 优势: 在更新过程中无需等待最终结果的出现。
- 缺点: 需要掌握环境的全部信息;面临维度爆炸的问题。
Monte Carlo Methods
-
思路:
借助经验(包括状态、动作以及奖励的样本序列)来推导出最优策略。例如,在初始状态s中,依照策略π执行,最终得到总回报R,这构成了一条样本数据。若我们拥有大量此类样本,则可以估算在状态s下,采用策略π所能获得的期望回报值。- 优势: 蒙特卡罗方法无需掌握环境的全部信息(与动态规划方法不同)。仅需依赖经验(
全部评论 (0)
还没有任何评论哟~
