分层强化学习的鼻祖:Feudal Reinforcement Learning 1993
发布时间
阅读量:
阅读量
1993年的分层强化学习:Feudal Reinforcement Learning
概括
1992年尚未出现深度学习技术,当时人们在研究强化学习(RL)时所采用的思路与现今存在明显差异。然而必须承认的是,提出“分层强化学习”的理念,为解决“泛化能力与学习效率”等关键问题提供了一个颇具价值的探索方向。
Feudal方法类似于从宏观到微观逐级进行指挥调度,在此过程中需要特别关注的一个概念是“层级封装”,即A-B-C三层结构中,C层仅负责执行B层赋予的具体目标(或依据其设计的奖励机制),而不涉及A层的内容;同时对于接收到的信息也是如此,C层无法获取A层的信息。
这种结构与人类的决策过程高度契合:例如在篮球比赛中,我的整体战略(第一层)是实施一对一盯防;随后我将这一战略付诸实践(第二层),针对对位的投手采取贴近防守的方式,以干扰其跑位、接球及投篮动作;至于具体的执行方式(第三层),则更多依赖于本能反应以及自身的体能和技术水平,如防守动作的选择和临场跑动判断等。
作者指出,在强化学习领域中,此类分层次的学习模式无疑更具优势:尽管训练初期可能存在由下至上信息传递的影响,但随着训练进程推进,系统将逐渐转变为自上而下的控制模式。因为高层动作相对较少(可理解为宏观策略的数量有限),且对整体结果具有决定性影响。
那么,这种分层次的思想对当前强化学习的发展具有怎样的
全部评论 (0)
还没有任何评论哟~
