Reinforcement Learning (No. 8)
发布时间
阅读量:
阅读量
此前提及的一个关键问题,即如何有效地将交叉熵算法应用于大规模数据集的场景中。
之前提到过,在诸如骑自行车这类问题上,由于状态数量可能仅有十个,动作数量也仅有四个,因此交叉熵方法是适用的。然而,当面对自动驾驶或电子游戏等复杂任务时,该方法则难以奏效。这是因为此时我们无法再通过表格形式记录所有可能状态与对应动作的概率分布,因为状态空间可能达到数十亿级别,甚至是一个连续空间,根本无法进行存储。
这种表格的存储不仅在现实中不可行,而且在计算效率上也极低。一旦某个状态发生细微变化,智能体就需要从零开始重新学习,因为这被视为一个全新的、从未经历过的状态。
显然,人类的学习方式并非如此。我们具备强大的泛化能力,因此也希望强化学习算法能够实现类似的能力。在这种情况下,就可以引入近似强化学习的方法。

此时我们不再需要明确存储所有概率信息,而是借助机器学习算法进行学习,比如采用神经网络,或是回归分析、随机森林等各类方法,使其能够模拟并完成学习过程。
例如在某一游戏场景中,agent 进行了 N 次操作,从中挑选出 M 次表现最优的案例,称为精英游戏。此时不再对表格进行更新,而是通过多次
全部评论 (0)
还没有任何评论哟~
