Advertisement

强化学习随机策略梯度TRPO的置信域策略优化推导分析《Trust Region Policy Optimization》

阅读量:

一、TRPO优化目标公式建立

【基于策略梯度的算法在参数更新过程中,难以确定一个合适的步长以确保策略持续优化。若步长设置不当,可能会导致模型性能逐步下降,甚至引发系统失效。因此,如何选取一个恰当的步长,或者如何设计新的策略以确保回报函数值呈现出单调递增或至少保持稳定增长的趋势,成为TRPO方法所要解决的核心问题。

在强化学习中,回报函数被定义为:
\eta(\tilde{\pi} )=E_{\tilde{\pi}}[\sum_{t=0}^{\infty}\gamma^t(r(s_t))]

通过将新策略的回报函数拆解为旧策略回报函数与额外项之和的形式进行分析,可以得出:当额外项大于等于零时,新策略的回报函数将保持单调不减。具体表达如下:
\eta(\tilde{\pi})=\eta(\pi)+E_{s_0,a_0,\tilde{\pi}}[\sum_{t=0}^\infty\gamma^tA_\pi(s_t,a_t)]\qquad (1)

其中用\pi表示旧策略,\tilde\pi表示新策略。
关于优势函数A_\pi(s,a)的定义如下:

\begin{aligned} A_\pi(s,a)&=Q_\pi(s,a)-V_\pi(s)\\ &=E_{s'\sim P(s'|s,a)}[r(s)+\gamma V_\pi(s'

全部评论 (0)

还没有任何评论哟~