Advertisement

mini-batch gradient descent method

阅读量:

一、背景

基于传统梯度下降的方法,在每一次迭代中都会计算所有训练数据的平均值来更新模型参数。我们通常将其称为full-batch gradient descent方法。假设在实际应用中遇到的数据规模达到千万级别时,在每次迭代所需的时间会显著增加,并导致训练速度大幅降低。

每次都使用相同的训练数据集,并非随机选取不同的数据进行训练。因此loss损失函数持续下降,并最终收敛至全局最优解。

**

**

二、mini-batch梯度下降

如果选择介于1和最大训练数据量之间的某个 bath size用于训练过程,则称为 mini-batch 梯度下降。

在每一次训练中, 我们无法确保每次都使用相同的训练数据集, 因此,在每一个batch中可能并不会持续下降. 然而, 整体的趋势仍然是不断下降的. 虽然如此, 在达到最优值的过程中可能会产生一些波动.

**

**

*三、比较

全部评论 (0)

还没有任何评论哟~