Advertisement

强化学习的概述

阅读量:

文章目录

  • 1. 强化学习算法
  • 2. 基于序列决策的过程
  • 3. 动作空间
  • 4. 智能体结构与类型分析
    • 4.1 策略设计

        • 问题:探讨随机策略与确定性策略各自的优缺点
      • 4.2 价值函数

      • 4.3 模型

      • 4.4 类型

    • 5. 学习与规划

    • 6. 探索和利用

    • Reference

1. 强化学习

(1)定义
一个智能体(agent)如何在一个复杂不确定的环境中最大化其获得的奖励。
(2)过程
这个过程是一个系统性地、有序地、动态地探索和利用复杂不确定环境中的潜在机会的过程。

在这里插入图片描述

1: 智能体通过感知环境的状态,并随后生成相应的动作(即决策)
2: 环境响应所采取的行动后会给出新的状态信息以及相应的奖励

对比分析:强化学习与监督学习

(1)强化学习接收的是按时间顺序排列的数据,并不具备独立同分布假设

(2)强化学习缺乏即时反馈机制

(3)延迟奖励(即延迟奖励:delayed reward.)

通常假设样本空间

全部评论 (0)

还没有任何评论哟~