Advertisement

Reinforcement Learning采用随机策略梯度算法(Stochastic Policy Gradient Algorithm)

阅读量:

策略搜索方法相较于值函数法具有以下优势与不足之处:
优点:

  1. 直接策略搜索方法对策略\pi进行参数化表达,相较于值函数法中对价值函数的参数化处理,策略的参数化方式更为简洁,并且具备更优的收敛特性。
  2. 在使用值函数法寻找最优策略的过程中,需要计算argmax_a Q_\theta(s,a)以实现策略优化。然而,当面对动作空间极大或动作属于连续集合的情形时,该表达式难以获得有效的解。
  3. 直接策略搜索方法通常采用随机性策略,能够有效学习随机决策模式,并将探索机制直接融入到策略的设计之中。

缺点:

  1. 策略搜索方法在实施过程中容易陷入局部最优解,难以找到全局最优结果。
  2. 在对单一策略进行评估时存在信息不足的问题,导致评估结果的方差较大。

一、基础算法推导

本文主要从重要性采样的视角展开探讨。

策略梯度的核心目标依然是实现累积回报的最大化,现定义一个参数化策略\pi_\theta的期望累积回报如下所示
\begin{aligned} J(\theta) = E_{\tau \sim p(\tau;\theta)}&=\int_{\tau\sim p(\tau;\theta)}p(\tau;\theta)r(\tau)d\tau\\ \end{aligned}
$p(\tau;\the

全部评论 (0)

还没有任何评论哟~