掌握梯度下降的原理及其实现方法
发布时间
阅读量:
阅读量
梯度下降被广泛认为是神经网络中寻找极小值点(鞍点情况)的主要应用方法;本文以BP神经网络为例阐述其数学原理及其推广。
代价函数
为了量化我们神经网络的拟合效果,我们定义一个代价函数:
我们训练算法的目的,就是最小化权值和偏置的代价函数C(w,b) 。
针对代价函数,我们试着回答以下两个问题:
- 为什么不直接采用分类(识别)正确的数量作为评价指标呢?
这是因为,在神经网络中,成功分类图像的数量与权值和偏置之间的映射关系并非平滑函数。通常情况下,权值和偏置的小幅调整对成功分类图像的数量没有显著影响。这使得我们很难找到一种方法来提升神经网络的学习性能。
- 为什么要用二次函数呢?
没有任何一种代价函数是绝对唯一的,在实际应用中不同类型的代价函数也会有不同的适用场景与评价标准。其中一种最为常用并且应用广泛的模型是二次型功能(quadratic function),其显著特点是采用均方误差(MSE)作为衡量预测值与真实值之间差异的标准指标。随着后续内容展开,请问读者是否已经意识到这一独特模型在多个实际问题中展现出的优势?当然,在深入学习其他复杂模型之前,请您耐心理解这一基础模型的基本原理及其在理论构建中的重要地位。
为什么要梯度下降?
我们的目标是致力于寻找C的全局最小值。当然,在面对容易处理的情况时(即简单的二次型函
全部评论 (0)
还没有任何评论哟~
