Advertisement

深度学习20号强化学习中的黑盒优化

阅读量:

强化学习中的黑盒优化

▪ 进化策略。
▪ 遗传算法。

该独特的优势在于其显著超越基于梯度算法的表现(相比基于梯度的方法而言),因为无需执行反向传播步骤即可快速获得精确导数信息。
从黑箱角度来看,并非会对优化目标以及被视作黑箱处理的对象做出过多假设;当奖励函数不够光滑或者策略中包含随机选择时(当奖励函数不平滑或策略包含随机选择时),传统优化方案往往难以应对这些问题。
从黑箱角度来看,并非会对优化目标以及被视作黑箱处理的对象做出过多假设;当奖励函数不够光滑或者策略中包含随机选择时(当奖励函数不平滑或策略包含随机选择时),传统优化方案往往难以应对这些问题。
这类方法通常表现出良好的可扩展性(即可以通过并行计算将搜索规模扩大到数千个CPU或GPU级别),并且彼此之间几乎完全独立运行;而像DQN等传统算法则不然(即像DQN等传统算法不同),因为它们需要累积误差并在多个工人之间传播当前策略以提高收敛速度。
同时这类算法往往面临较高的采样效率问题(尤其是在仅进行单纯随机搜索的情况下);由于其参数空间通常涉及几十万个神经网络参数(尤其是单纯使用参数化神经网络进行随机搜索的情况),成功概率极低。

进化策略

设定学习速率α、噪声标准差σ以及初始值策略参数θ₀。
对于时间步长t=0,1,2,…执行以下操作:
首先生成具有加权形状分布的噪声样本序列:ε₁,…,εₙ∼N(0,I)

全部评论 (0)

还没有任何评论哟~