深度学习7-DQN的扩展
发布时间
阅读量:
阅读量
2022.6.1 rl-8
DQN扩展
▪ N步DQN:如何通过扩展Bellman方程以提升算法的收敛速度与稳定性,以及为何它并非最终的解决方案。
▪ Double DQN:如何解决DQN在评估动作价值时出现的过高估计问题。
▪ 噪声网络:如何通过在网络权重中引入噪声来提高探索效率。
▪ 带优先级的回放缓冲区:为何对经验进行均匀采样并非训练过程中的最佳选择。
▪ Dueling DQN:如何通过调整网络结构使其更贴近所解决的问题,从而加快收敛速度。
▪ Categorical DQN:如何突破单一动作预期价值的限制,转而使用完整的分布形式。
DQN与Q-learning同属基于值迭代的算法,但在普通的Q-learning中,当状态和动作空间为离散且维度较低时,可以通过Q-Table存储每个状态-动作对对应的Q值;然而当状态和动作空间为高维连续空间时,采用Q-Table将变得极为困难。
因此可以将Q-table更新转化为一个函数拟合问题,通过拟合一个函数来替代Q-table生成Q值,使得相近的状态能够产生相近的动作输出。鉴于深度神经网络在复杂特征提取方面的良好表现,可考虑将深度学习与强化学习相结合。这便是DQN的基本思路。
DL与RL结合存在如下问题:
DL属于监督学习范畴,需要依赖训练集进行学习;而强化学习并不需要训
全部评论 (0)
还没有任何评论哟~
