学习笔-神经网络与正则化
发布时间
阅读量:
阅读量
神经网络与正则化
正则化项在模型训练过程中起到抑制过拟合现象的作用,若未在深层神经网络结构中引入相应的正则化机制,则极易导致模型出现严重的过拟合问题。
1 L2 Regularization
1.1 正则化惩罚到底做了什么?
在诸多防止过拟合的技术手段中,L2正则化是最为常见的一种,其核心原理在于对损失函数引入额外的系数惩罚项——即在原有公式的基础上,加上所有权重系数的平方和。
原始损失函数表达式如下:
经过L2正则化处理后的损失函数形式为:
当将L2正则化项引入神经网络模型后,其前向传播过程保持不变;但在反向传播计算过程中,针对 dW 的梯度计算需额外加入正则化项的梯度部分(即 \frac{d}{dW} ( \frac{1}{2}\frac{\lambda}{m} W^2) = \frac{\lambda}{m} W)。
1.2 正则化惩罚为什么会起作用?
L2惩罚所依赖的核心假设为:模型中各系数的数值越低,意味着模型的复杂程度越低(为何更简单的模型具有优势?依据奥卡姆剃刀原则,当简单模型与复杂模型均能对同一现象作出合理解释时,人们通常会优先采用更为简洁的模型——括号内内容为个人推测)。
通过在损失函数中引入系数的平方项,能够促使所有系数趋向于减小(若
全部评论 (0)
还没有任何评论哟~
