Advertisement

深度模型优化——Momentum|AdaGrad|RMSProp|Adam

阅读量:

文章目录

  • 在深度学习框架中实现高效的参数更新机制——动量法|AdaGrad|RMSProp|Adam

    • 学习速率对梯度下降过程的影响分析
    • 学习速率优化方法的评估基准
  • 一种改进型SGD学习率提升方案

  • 按线性方式进行的学习率衰减策略

  • 动量衰减(momentum decay)方法

  • 基于Nesterov梯度的动量优化方法

  • 自适应梯度优化算法(AdaGrad)

  • 均方根传播算法(RMSProp)

  • Adam优化算法

    • 常用方案的对比总结

深度模型中的优化——momentum|AdaGrad|RMSProp|Adam

在随机梯度下降中,遵循最快下降路径可以获得最快的下降速度:x_{t+1}=x_t-\lambda \triangledown f(x_t)。其中\lambda是该算法中的步长值,在算法中也称为学习速率。

在常见的SGD算法中,批量梯度下降(BSGD)的算法如下:(引用《深度学习》(花书)P180)

算法描述:在第k次训练迭代中使用随机梯度下降(SGD)进行参数θ的更新运算

PS:花书中把学习率记为 \epsilon,把收敛条件记为\lambda.

全部评论 (0)

还没有任何评论哟~