Reinforcement Learning采用随机策略梯度算法(Stochastic Policy Gradient Algorithm)
发布时间
阅读量:
阅读量
策略搜索方法相较于值函数法具有以下优势与不足之处:
优点:
- 直接策略搜索方法对策略\pi进行参数化表达,相较于值函数法中对价值函数的参数化处理,策略的参数化方式更为简洁,并且具备更优的收敛特性。
- 在使用值函数法寻找最优策略的过程中,需要计算argmax_a Q_\theta(s,a)以实现策略优化。然而,当面对动作空间极大或动作属于连续集合的情形时,该表达式难以获得有效的解。
- 直接策略搜索方法通常采用随机性策略,能够有效学习随机决策模式,并将探索机制直接融入到策略的设计之中。
缺点:
- 策略搜索方法在实施过程中容易陷入局部最优解,难以找到全局最优结果。
- 在对单一策略进行评估时存在信息不足的问题,导致评估结果的方差较大。
一、基础算法推导
本文主要从重要性采样的视角展开探讨。
策略梯度的核心目标依然是实现累积回报的最大化,现定义一个参数化策略\pi_\theta的期望累积回报如下所示
\begin{aligned} J(\theta) = E_{\tau \sim p(\tau;\theta)}&=\int_{\tau\sim p(\tau;\theta)}p(\tau;\theta)r(\tau)d\tau\\ \end{aligned}
$p(\tau;\the
全部评论 (0)
还没有任何评论哟~
