Advertisement

Deep Reinforcement Learning (DRL)

阅读量:

强化学习分类研究

Policy-based or value-based

强化学习主要分为两类,分别为基于策略的Policy-Based(Policy Gradients)和基于价值的Value-Based(Q-Learning)。在Policy-Based方法中,直接根据当前环境状态预测应采取的动作;而Value-Based方法则评估在特定环境状态下各个动作的期望价值(即Q值),并选择具有最高Q值的动作进行执行。Value-Based方法适用于动作空间较小且为离散值的情况,而Policy-Based方法则更适合动作种类繁多或为连续值的场景。策略网络与价值网络是实现这两种方法的核心结构。

Policy Gradients方法通过训练策略网络来实现决策过程。模型依据在环境中采取的动作所获得的反馈信息,利用梯度下降法对参数进行更新。在训练过程中,模型会接触到具有高预期价值的良好动作以及预期价值较低的不良动作。通过对这些样本的学习,模型逐步提高选择优质动作的概率,并降低选择劣质动作的可能性,从而完成策略的学习过程。该方法直接学习当前环境下应当采取的具体策略,例如选择某一特定动作的概率或具体数值。策略网络采用端到端的方式进行训练,能够直接生成最终决策方案。

Model-Based RL通过根据当前环境状态及所采取的动作预测后续环境状态,并利用这些信息对强化学

全部评论 (0)

还没有任何评论哟~