Advertisement

强化学习算法——深度Q网络DQN

阅读量:

文章目录

  • 参考文献
    • 1. 批评

      • 1.1 状态价值函数

        • 1.1.1 蒙特卡洛方法
        • 1.1.2 时间差分方法
        • 蒙特卡洛方法与时间差分方法的对比
      • 1.2 状态-动作价值函数

    • 2. 深度Q网络

      • 2.1 目标网络(Target Network)

      • 2.2 探索(Exploration)

        • 3.2.1 \epsilon-贪心策略
        • 3.2.2 玻尔兹曼探索(Bolzman exploration)
      • 3.3 经验回放(experience replay)

      • 3.4 深度Q网络结构

        • 存在的问题:DQN与Q学习之间的差异

Reference

[1] https://github.com/datawhalechina/easy-rl
[2] https://youtu.be/2-zGCx4iv_k

1. Critic

定义
用于衡量特定策略(actor)优劣的网络结构,其功能在于评估而非直接参与动作的选择过程。

![在这里插入图片描述](https://ad.itadn.com/c/weblog/blog-img/images/2025-05-31/F

全部评论 (0)

还没有任何评论哟~