Advertisement

强化学习常见算法对比

阅读量:

目录

  • 动态规划
    • 蒙特卡洛方法
    • 时间差分学习
    • 多步引导技术
    • 深度Q网络
      • 研究背景
      • 优化方案

Dynamic Programming

  • 思路:
    通过Bellman方程进行迭代运算,每轮迭代中,基于所有状态s在第k次迭代所得的vk(s’)值,计算出第k+1次迭代对应的vk+1(s)数值。借助这一过程的持续循环,最终可使结果趋于收敛,达到最优解v∗(s)。
    Bellman方程:
  • 优势: 在更新过程中无需等待最终结果的出现。
    • 缺点: 需要掌握环境的全部信息;面临维度爆炸的问题。

Monte Carlo Methods

  • 思路:
    借助经验(包括状态、动作以及奖励的样本序列)来推导出最优策略。例如,在初始状态s中,依照策略π执行,最终得到总回报R,这构成了一条样本数据。若我们拥有大量此类样本,则可以估算在状态s下,采用策略π所能获得的期望回报值。

    • 优势: 蒙特卡罗方法无需掌握环境的全部信息(与动态规划方法不同)。仅需依赖经验(

全部评论 (0)

还没有任何评论哟~