编写并演示一个简单的增强学习实例
发布时间
阅读量:
阅读量
接下来,我们将运用先前介绍的Q-Learning算法,尝试构建一个具有趣味性的实例。
1. 算法效果
我们所期望构建的,是一辆具备特定功能的车辆。该车辆拥有两种基本操作模式,在任意时间点均可选择向左或向右移动,我们的最终目的是引导其顺利抵达山顶。初始阶段,小车仅能以随机方式左右移动,但经过一段时间的学习与训练后,便能够高效地实现预设的目标任务。

2. Deep Q Learning 算法简单介绍
正如在上一章节中所简要提及的,本研究所采用的算法为最基本的Deep Q Learning方法,其具体操作流程如图所示。

从整体结构来看,该算法主要由以下几个关键组成部分构成
1. replay_buffer
在系统持续训练的过程中,会不断生成大量训练数据。尽管这些数据并非针对当时环境的最佳策略,但它们是通过与环境互动所积累的经验,对于系
全部评论 (0)
还没有任何评论哟~
