Advertisement

深度学习(6)高级强化学习库

阅读量:

高级强化学习库概述

▪ 采用成熟库的优势在于无需从零开始构建所有功能。
▪ 将通过具体代码实例阐述PTAN库及其核心组件。
▪ 在CartPole环境中,借助PTAN库完成DQN算法的实现。
▪ 此外,还可探索其他适用于强化学习的库选项。

为什么使用强化学习库

强化学习具有高度的灵活性,许多现实世界中的问题本质上属于环境与智能体之间交互的范畴。强化学习方法对观察和动作的具体细节不做过多假设,因此用于解决CartPole环境的代码同样适用于Atari游戏(可能需要进行一些微调)。

PTAN提供了以下组件:
▪ Agent:一种能够将一组观察转换为一组待执行动作的类。它还可以包含可选状态,当需要在某个片段中记录某些信息以供后续动作使用时会用到。(我们将在第17章中使用这一方法,在深度确定性策略梯度(Deep Deterministic Policy Gradient,DDPG)算法中,探索过程需要用到奥恩斯坦–乌伦贝克随机过程)。该库已经内置了多个适用于常见强化学习场景的智能体类,当然用户也可以自行编写继承自BaseAgent的子类。
▪ ActionSelector:一小段与Agent协同工作的逻辑模块,它能够从网络输出中选择合适的动作。
▪ ExperienceSource及其变种:通过Agent实例和Gym环境对象提供关

全部评论 (0)

还没有任何评论哟~