强化学习算法(一)表格型方法
发布时间
阅读量:
阅读量
文章目录
-
1. 马尔科夫决策模型
-
2. Q表
-
3. 自由模型预测
-
- 3.1 蒙特卡洛策略评估方法
-
- 问题:探讨动态规划法与蒙特卡罗方法之间的异同点
-
3.2 时序差分
-
- 问题:比较蒙特卡洛和时序差分法
-
-
4. 免模型控制
-
-
4.1 基于epsilon-贪心策略的MC方法
-
4.2 基于相同策略的时序差分学习(SARSA)
-
4.3 基于不同策略的时序差分学习(Q-Learning)
-
问题:对比分析SARSA与Q-Learning算法的特点
-
4.4 同策略和异策略的区别
-
-
参考资料
-

1. 马尔可夫决策过程
我们采用概率转移函数p[s_{t+1},r_t| s_t,a_t]以及奖励函数r[s_t,a_t]来描述环境情况。
(1)基于模型
当掌握概率函数以及奖励函数时,在此环境下马尔可夫决策过程得以建立。
通过策略迭代或价值迭代方法可以获得智能体的理想策略选择路径,在此过程
全部评论 (0)
还没有任何评论哟~
