Advertisement

深度学习和优化算法

阅读量:

本篇文章阐述了若干常用的数值优化算法,这些技术手段在当前主流的神经网络计算平台(如tensorflow、caffe、torch)中已被纳入基础功能模块。

问题

定义系统参数为\omega。针对每一个样本i,对应的损失函数表示为Q_i(\omega)。当训练集由n个样本构成时,整体的损失函数可表示为:
Q(\omega)=\sum_{i=1}^nQ_i(\omega)

目标是确定参数\omega,使得上述表达式取得最小值。由于该问题不存在解析解,因此需借助近似迭代的方法进行逐步求解。

基础一阶优化策略

GD

GD(Gradient Descent)以\eta作为学习率参数,在每一次迭代过程中采用一阶泰勒展开的方式进行近似计算:
\omega_{t+1}=\omega_t - \eta\nabla Q(\omega)

通过将梯度运算与求和操作进行交换,GD方法在每次更新时依赖于所有样本同步计算梯度的总和:
\omega_{t+1}=\omega_t - \eta\sum_{i=1}^n\nabla Q_i(\omega)

假设\omega具有D维特征空间,而代价函数Q为一个标量值,那么减号后所对应的梯度结果同样构成一个D维向量。

SGD

SGD(St

全部评论 (0)

还没有任何评论哟~