机器学习系列手记(七):优化算法中的随机梯度加速技术
发布时间
阅读量:
阅读量
优化算法
随机梯度下降法加速策略
在深度学习领域中,优化算法的选取往往首先联想到随机梯度下降方法。然而,这一算法在某些情况下反而可能成为制约模型性能的障碍。当构建完成一个深度神经网络后,若仅依赖随机梯度下降进行模型训练,一旦出现训练效果不佳的情况,研究者可能会倾向于放弃对该模型的进一步优化。但实际上,导致训练结果不理想的原因未必源于模型设计本身,而可能是随机梯度下降在优化过程中未能有效发挥作用所致。
1、随机梯度下降法实效的原因
随机梯度下降方法犹如蒙眼下山,仅能通过脚下的触感感知坡度,从而判断当前所处位置,其精确程度明显下降;而批量梯度下降则如同正常行走下山一般,能够更准确地进行方向判断。批量梯度下降法在全部训练集{x_i,y_i}_{i=1}^{n}上计算出精确的梯度表达式为:
\sum_{i=1}^{n}▽_{\theta}f(\theta;x_i,y_i)+▽_{\theta} \phi(\theta)
其中f(\theta;x_i,y_i)表示每个样本 (x_i,y_i) 对应的损失函数, \phi(\theta) 为正则化项。
相较之下,随机梯度下降法则通过单个样本对当前梯度进行估算,其表达式为:
$▽{\theta}f(\theta;x_i,y_i)+▽{\theta} \phi(\t
全部评论 (0)
还没有任何评论哟~
