Advertisement

论文笔记--Unsupervised Meta-RL

阅读量:

无监督的(元)强化学习总结

  • DIAYN
      • 核心理念
      • 构建方式
    • UML

    • (非策略)DADS

      • 核心理念:
        • 非策略版本
        • 基于技能动态的规划方法
    • DDL

      • 核心理念:
        • 距离评估
        • 策略优化

DIAYN

该研究的完整名称为《Diversity Is All You Need: Learning skills without a reward function》。关键词包括:在无奖励信号条件下进行技能学习;为后续任务预训练的技能;分层方式解决任务问题。一句话概括其核心观点:采用无监督(即不依赖奖励信号)的方式获取具有实用价值的技能,作为一种高效的预训练策略,以应对强化学习过程中面临的探索难度与样本利用效率方面的挑战。

Key Idea

学习目标:由于reward function的未知性,传统意义上的最大化累计奖励回报已无法作为目标,取而代之的是要求所学习到的所有skills之间具备区别性,并且这些skills整体上能够探索大部分状态空间。具体而言,我们希望训练出一系列skills,这些skills能够涵盖绝大多数可能的行为(例如跑、跳、走等复合动作,而非单一动作)。当面对

全部评论 (0)

还没有任何评论哟~