深度学习课程-强化学习在离散优化中的应用
发布时间
阅读量:
阅读量
强化学习在离散优化中的应用
▪ 简要阐述离散优化的相关基本概念。
▪ 依次介绍UCI研究人员Stephen McAleer等人发表的论文“Solving the Rubik's Cube Without Human Knowledge”(2018, arxiv: 1805.07470),该研究将强化学习方法引入到魔方的优化问题中。
▪ 探讨我所进行的实验,以复现论文中的结果,并指出未来可能改进的方向。
在选择状态的具体表示方式时,我们需要考虑多个不同的目标:
▪ 避免冗余信息:在极端情况下,我们只需要记录魔方每一面中每个贴纸的颜色即可描述其状态。然而,若计算这些组合的数量,会得到66·8 = 648≈2.5×1037,这个数值远超魔方的实际状态空间大小,这表明这种表示方式存在高度冗余。例如,它允许所有面都具有相同颜色(中心块除外)。如果你好奇我是如何得出这个数字的,其实很简单:魔方共有六个面,每个面上有八个格子(不包括中心),因此总共包含48个贴纸,每个贴纸都有六种颜色可选。
▪ 内存效率:你很快会发现,在训练阶段以及模型实际应用过程中,我们需要在计算机内存中存储大量不同的魔方状态,这可能会对处理性能产生影响。因此,我们希望采用尽可能简洁的状态表示形式。
▪ 转换效率:另一方面,在执行动作时需要快速完成所有操作。如果我们的表示形式虽然在内
全部评论 (0)
还没有任何评论哟~
