使用梯度下降的TensorFlow
发布时间
阅读量:
阅读量
TensorFlow 的梯度下降
- 根据训练样本的大小三种梯度下降的变体
- TensorFlow优化器
- 变量
在导数等于零的点上(驻点),函数取得极值(极大值或极小值)。梯度下降算法基于相同的原理(驻点原理),即通过不断更新系数(权重和偏置)来降低损失函数的值。
在回归分析中(线性回归模型中),我们采用梯度下降方法来最小化损失函数并确定最佳拟合参数(系数)。基于 TensorFlow 梯度下降优化器及其相关的改进方案。
根据训练样本的大小三种梯度下降的变体
- Vanilla 梯度下降:在 Vanilla 梯度下降(也称作批梯度下降)中,在每个循环中计算整个训练集的损失函数的梯度。该方法可能很慢并且难以处理非常大的数据集。该方法能保证收敛到凸损失函数的全局最小值,但对于非凸损失函数可能会稳定在局部极小值处。
- 随机梯度下降:在随机梯度下降中,一次提供一个训练样本用于更新权重和偏置,从而使损失函数的梯度减小,然后再转向下一个训练样本。整个过程重复了若干个循环。由于每次更新一次,所以它比 Vanilla 快,但由于频繁更新,所以损失函数值的方差会比较大。
- 小批量梯度下降:该方法结合了前两者的优点,利用一批训练样本来更新参数。
TensorFlow优化器
TensorFlow 为你提供了各种各样的优化器:
全部评论 (0)
还没有任何评论哟~
