Advertisement

强化学习算法(一)表格型方法

阅读量:

文章目录

  • 1. 马尔科夫决策模型

    • 2. Q表

    • 3. 自由模型预测

      • 3.1 蒙特卡洛策略评估方法
      • 问题:探讨动态规划法与蒙特卡罗方法之间的异同点
    • 3.2 时序差分

      • 问题:比较蒙特卡洛和时序差分法
  • 4. 免模型控制

      • 4.1 基于epsilon-贪心策略的MC方法

      • 4.2 基于相同策略的时序差分学习(SARSA)

      • 4.3 基于不同策略的时序差分学习(Q-Learning)

      • 问题:对比分析SARSA与Q-Learning算法的特点

      • 4.4 同策略和异策略的区别

    • 参考资料

在这里插入图片描述

1. 马尔可夫决策过程

我们采用概率转移函数p[s_{t+1},r_t| s_t,a_t]以及奖励函数r[s_t,a_t]来描述环境情况。
(1)基于模型
当掌握概率函数以及奖励函数时,在此环境下马尔可夫决策过程得以建立。
通过策略迭代或价值迭代方法可以获得智能体的理想策略选择路径,在此过程

全部评论 (0)

还没有任何评论哟~