强化学习的概述
发布时间
阅读量:
阅读量
文章目录
- 1. 强化学习算法
- 2. 基于序列决策的过程
- 3. 动作空间
- 4. 智能体结构与类型分析
-
-
4.1 策略设计
-
- 问题:探讨随机策略与确定性策略各自的优缺点
-
4.2 价值函数
-
4.3 模型
-
4.4 类型
-
-
5. 学习与规划
-
6. 探索和利用
-
Reference
-
1. 强化学习
(1)定义
一个智能体(agent)如何在一个复杂不确定的环境中最大化其获得的奖励。
(2)过程
这个过程是一个系统性地、有序地、动态地探索和利用复杂不确定环境中的潜在机会的过程。

1: 智能体通过感知环境的状态,并随后生成相应的动作(即决策)
2: 环境响应所采取的行动后会给出新的状态信息以及相应的奖励
对比分析:强化学习与监督学习
(1)强化学习接收的是按时间顺序排列的数据,并不具备独立同分布假设
(2)强化学习缺乏即时反馈机制
(3)延迟奖励(即延迟奖励:delayed reward.)
通常假设样本空间
全部评论 (0)
还没有任何评论哟~
