论文笔记--Unsupervised Meta-RL
发布时间
阅读量:
阅读量
无监督的(元)强化学习总结
- DIAYN
-
- 核心理念
- 构建方式
-
UML
-
(非策略)DADS
-
- 核心理念:
-
- 非策略版本
- 基于技能动态的规划方法
-
DDL
-
- 核心理念:
-
- 距离评估
- 策略优化
-
DIAYN
该研究的完整名称为《Diversity Is All You Need: Learning skills without a reward function》。关键词包括:在无奖励信号条件下进行技能学习;为后续任务预训练的技能;分层方式解决任务问题。一句话概括其核心观点:采用无监督(即不依赖奖励信号)的方式获取具有实用价值的技能,作为一种高效的预训练策略,以应对强化学习过程中面临的探索难度与样本利用效率方面的挑战。
Key Idea
学习目标:由于reward function的未知性,传统意义上的最大化累计奖励回报已无法作为目标,取而代之的是要求所学习到的所有skills之间具备区别性,并且这些skills整体上能够探索大部分状态空间。具体而言,我们希望训练出一系列skills,这些skills能够涵盖绝大多数可能的行为(例如跑、跳、走等复合动作,而非单一动作)。当面对
全部评论 (0)
还没有任何评论哟~
