深度学习模型加速强化学习训练
发布时间
阅读量:
阅读量
2022.6.2 rl-9
加速强化学习训练的方法
▪ 采用第8章中提供的Pong环境,并努力以最快速度完成该任务。
▪ 在完全相同的硬件配置下,逐步攻克Pong问题,并将处理速度提高3.5倍。
▪ 探讨更为先进的策略以加快强化学习(RL)训练过程,这些方法在未来的应用中或将变得普遍。
即便是基础的机器学习问题,在初次尝试时也很难准确实现。
在确定合适的超参数、修正所有错误并使代码正常运行之前,往往需要进行多次尝试。物理模拟、强化学习研究、大规模数据处理以及常规编程都遵循这一流程。因此,若能提升程序的执行效率,不仅单次运行会受益,还能加快代码迭代速度并进行更多次实验,从而显著提升整体处理效率和最终结果的质量。
在训练过程中,代码会向TensorBoard输出多个指标:
▪ reward:从每个片段中获得的原始奖励值,横轴表示片段数量。
▪ avg_reward:与奖励类似,但使用alpha=0.98进行平均值的平滑处理。
▪ steps:每个片段持续的步数。通常情况下,在初期智能体很快就会失败,因此每个片段大约为1000步左右。随后随着智能体能力的提升,步数和奖励同步增加。然而,在后期当智能体能够熟练掌握游戏时,步数又回落至2000步左右,这是因为策略优化的目标是尽快赢得游戏(由于折扣因子γ的存在)。实际上,这
全部评论 (0)
还没有任何评论哟~
