强化学习算法——深度Q网络DQN
发布时间
阅读量:
阅读量
文章目录
- 参考文献
-
1. 批评
-
-
1.1 状态价值函数
-
- 1.1.1 蒙特卡洛方法
- 1.1.2 时间差分方法
- 蒙特卡洛方法与时间差分方法的对比
-
1.2 状态-动作价值函数
-
-
2. 深度Q网络
-
-
2.1 目标网络(Target Network)
-
2.2 探索(Exploration)
-
- 3.2.1 \epsilon-贪心策略
- 3.2.2 玻尔兹曼探索(Bolzman exploration)
-
3.3 经验回放(experience replay)
-
3.4 深度Q网络结构
-
- 存在的问题:DQN与Q学习之间的差异
-
-
Reference
[1] https://github.com/datawhalechina/easy-rl
[2] https://youtu.be/2-zGCx4iv_k
1. Critic
定义
用于衡量特定策略(actor)优劣的网络结构,其功能在于评估而非直接参与动作的选择过程。

还没有任何评论哟~
