Advertisement

深度学习的优化器属于优化算法

阅读量:

前言

前面已经讲过几中梯度下降算法了,并且给了一个收尾引出这一章节,想看的小伙伴可以去看看这一篇文章:机器学习之梯度下降算法。前面讲过对SGD来说,最要命的是SGD可能会遇到“峡谷”和“鞍点”两种困境峡谷类似⼀个带有坡度的狭长小道,左右两侧是 “峭壁”;在峡谷中,准确的梯度方向应该沿着坡的方向向下,但粗糙的梯度估计使其稍有偏离就撞向两侧的峭壁,然后在两个峭壁间来回震荡。鞍点的形状类似⼀个马鞍,⼀个方向两头翘,⼀个方向两头垂,而中间区域近似平地;⼀旦优化的过程中不慎落入鞍点,优化很可能就会停滞下来(坡度不明显,很可能走错方向,如果梯度为0的区域,SGD无法准确察觉出梯度的微小变化,结果就停下来)。为了形象,还找了个图:

针对SGD面临的关键挑战设计了一系列创新性的改进措施。首要任务是确定优化策略的核心方向:动量保持机制以及自适应调整能力。

惯性保持: 引入动量项(Momentum, Nesterov Accelerated Gradient)
环境感知: 基于一些经验值依据(AdaGrad, AdaDelta, RMSPro

全部评论 (0)

还没有任何评论哟~