Advertisement

深度学习中的置信域:PPO、TRPO、ACKTR及SA

阅读量:

C置信域:PPO、TRPO、ACKTR及SA

▪ 近端策略优化(PPO)。
▪ 置信域策略优化(TRPO)。
▪ 基于Kronecker-factored trust region的A2C方法(ACKTR)。

TRPO是由伯克利的研究人员在2015年John Schulman等人撰写的论文“Trust Region Policy Optimization”(arXiv: 1502.05477)中首次提出。该研究旨在提升随机策略梯度优化过程中的稳定性和一致性,并在多种控制任务中均表现出良好的应用效果。然而,由于该方法涉及较为复杂的数学理论,理解其细节具有一定的难度,同时实现过程也较为繁琐,需要借助共轭梯度法来有效处理约束优化问题。

我们所比较的第三种方法ACKTR则采用了不同的方式来应对SGD的稳定性问题。Wu Yuhuai等人于2017年在其发表的论文“Scalable Trust-Region Method for Deep Reinforcement Learning Using Kronecker-Factored Approximation”(arXiv:1708.05144)中,将二阶优化与置信域方法相结合。二阶方法的基本思路是通过引入目标函数的二阶导数信息(即曲率),从而改善传统SGD算法在收敛性方面的表现。然而,计算二阶导数通常需要构建并求逆

全部评论 (0)

还没有任何评论哟~