Advertisement

三种强化学习方法

阅读量:

一、前言

强化学习(reinforcement learning, RL) 是继监督学习与无监督学习之后的另一种机器学习范式,其核心在于通过设定反映目标任务的奖励函数,引导智能体在与环境互动和试错过程中,逐步掌握能够实现累计收益最大化的行为策略。通常情况下,强化学习借助马尔科夫决策过程(Markov decision process, MDP) 来对问题进行形式化表达。强化学习系统的目标是构建一个策略(policy) 𝜋:即从当前状态到执行动作的概率映射。

深度强化学习(deep reinforcement learning, DRL) 是在强化学习所提供的最优决策能力基础上,融合深度学习(deep learning, DL)对高维数据的强大表征能力,从而拟合价值函数或策略,并通过交互样本训练出最优价值函数或策略。该方法被认为是实现感知智能与认知智能结合的有效手段。深度强化学习已在游戏人工智能、机器人控制、自然语言处理以及金融等多个领域展现出超越人类的表现。然而,在具有稀疏奖励、随机噪声等特性的环境中,传统随机探索方式难以获取包含有效奖励信息的状

全部评论 (0)

还没有任何评论哟~