Advertisement

强化学习相关问题

阅读量:

最近一次浏览了苏克在知乎上所写的强化学习问题,于是乎便开始自学了一下相关的内容,并发现自己的某些总结可能存在一些不足之处,在此诚挚地希望朋友们能够给予指正与反馈。

1. 强化学习与监督学习的区别

强化学习其本质是通过持续地与环境进行交互,并基于环境提供的奖励与惩罚结果不断调整优化自身的策略(即,在特定状态下采取相应的动作),最终目标是以最大化累计奖励和惩罚的形式实现更高的效率和效果)。

主要区别:

  1. 监督式的学习数据集包含明确标注的信息,而强化式的学习数据不具备明确标注信息;其知识更新机制依赖于与环境持续互动并接收奖励或惩罚信号。
  2. 监督式的学习过程呈现静态特征,在给定输入下仅输出对应结果;相比之下,强化式的学习过程具有动态性,在系统行为序列中逐步发展出优化策略。
  3. 在决策任务中表现更为突出的是强化式的方法;适用于执行特定任务的技术则更倾向于采用监督式的框架。

2. 强化学习解决序列决策问题

3. 马尔科夫决策过程

马尔可夫决策过程即为决策者按照一定顺序依次观察并评估具有马尔科夫特性的动态系统,并据此采取一系列决策行为。具体而言,在每一个观察时刻所获得的状态信息基础上选择可用行动集合中的相应策略参数进行操作。随后系统将进入下一状态并维持其特

全部评论 (0)

还没有任何评论哟~