时序差分是动态规划和蒙特卡罗的结合
发布时间
阅读量:
阅读量
**动态规划的核心优势在于:当状态转移概率和奖励函数已知时,在无需与环境进行交互的情况下(即直接基于模型),可以通过策略迭代法或值迭代法来求解最优策略。
动态规划的缺点: 然而在实际情况中 在环境中状态转移的概率通常是未知的 这种方法的实际应用受到限制
动态规划分析: 尽管动态规划不具备实际可行性, 其核心思想在于通过空间换取时间, 从而存储每个状态的价值函数(即Q表), 并通过后继状态的价值函数来推估当前的状态价值. 这种方法不仅实现了基于单步更新的技术框架, 还显著提高了计算效率, 并且这种思路也启发了时序差分方法的发展方向.
蒙特卡洛的优势: 当缺乏关于系统状态转移概率的知识时, 使用基于采样的平均方法来估计系统的期望值函数. 这里所说的"经验"即是指通过实验或采样获得的数据, 该方法的核心思想是在遵循当前策略进行大量重复试验的基础上, 每个试验都从任选初始状态出发并最终达到终止状态. 经过充分大的样本量(确保所有可能的状态-动作组合都被覆盖)后, 可以最大限度地逼近系统的真实期望值函数.
蒙特卡洛方法存在明显的缺陷:由于其基础是基于值函数的传统定义——即就是说从当前状态s出发一直到终止状态的所有累积奖励——这种方法必须等到系统达到终止状态后才能计算出相应状态下值函数的具体数值。因此更新过程非常缓慢而学习效率不高。
**蒙特卡洛分析:
全部评论 (0)
还没有任何评论哟~
