深度模型优化——Momentum|AdaGrad|RMSProp|Adam
发布时间
阅读量:
阅读量
文章目录
-
在深度学习框架中实现高效的参数更新机制——动量法|AdaGrad|RMSProp|Adam
- 学习速率对梯度下降过程的影响分析
- 学习速率优化方法的评估基准
-
一种改进型SGD学习率提升方案
-
按线性方式进行的学习率衰减策略
-
动量衰减(momentum decay)方法
-
基于Nesterov梯度的动量优化方法
-
自适应梯度优化算法(AdaGrad)
-
均方根传播算法(RMSProp)
-
Adam优化算法
- 常用方案的对比总结
深度模型中的优化——momentum|AdaGrad|RMSProp|Adam
在随机梯度下降中,遵循最快下降路径可以获得最快的下降速度:x_{t+1}=x_t-\lambda \triangledown f(x_t)。其中\lambda是该算法中的步长值,在算法中也称为学习速率。
在常见的SGD算法中,批量梯度下降(BSGD)的算法如下:(引用《深度学习》(花书)P180)
算法描述:在第k次训练迭代中使用随机梯度下降(SGD)进行参数θ的更新运算
PS:花书中把学习率记为 \epsilon,把收敛条件记为\lambda.
全部评论 (0)
还没有任何评论哟~
