梯度下降法的推导与总结
发布时间
阅读量:
阅读量
在传统的人工神经网络ANN的训练过程中,在每一次迭代的过程中都会有不同的参数更新需求,在每一次迭代的过程中都会有不同的参数更新需求
实际输出和目标输出之间的误差度量通常采用如下平方误差准则:

(注:word的向量表达式占多了一个空格的空间,如对排版不满,请多多包涵)
在以下讨论中涉及到了数据集D中的每个元素s及其相关属性。对于每个训练样本s来说,在这里我们定义Ts为其对应于该训练样本s的目标输出(即确定该实例所属的类别),而Os则表示该实例在经过神经网络处理后的实际输出结果。为了简化推导过程,在后续分析中引入了一个常数因子C,在数值上等于2,并且这一设定是为了与推导过程中产生的因子1/2相互抵消以简化计算过程。
现在我们探讨如何使训练误差E最小化。
观察式编号为1-1,在处理具体问题时,默认情况下将训练集合D视为一个固定不变的集合;其中Ts被视为一个固定不变的集合;而输出空间Os仅受权值向量w的影响;由此可知训练误差E作为权值向量w的函数而存在。
为了实现训练误差E最小化的目标而确定的权值向量w,在网络训练过程中被设定为初始值时可任选一具体数值w0,并通过不断迭代优化该权重向量;
全部评论 (0)
还没有任何评论哟~
