Advertisement

Mxnet chapter 8: dropout regularization method for overfitting prevention.

阅读量:

Dropout机制及其应用

传统的泛化理论显示,为减小训练与测试性能之间的差异,应使模型尽量保持简洁。这种简洁性也可以理解为平滑性,即模型不应对外部输入的细微变化产生过度反应。例如,在图像分类任务中,我们希望在像素上添加随机噪声不会对最终结果造成明显影响。当构建具有多层结构的深度网络时,在输入输出映射过程中引入噪声能够有效提升模型的平滑特性。

这一策略被称为dropout,在正向传播阶段计算每一层内部节点时都会加入随机噪声,该方法也逐渐发展成为训练神经网络的标准手段。在整个训练流程中,每次迭代操作时,在进行下一层计算前会将部分神经元的输出置零。

如图所示,一个包含五个隐藏单元的多层感知机(MLP)通过随机方式将部分单元置零后,输出结果不再依赖于h_2h_5这两个节点;在反向传播阶段,相应的梯度信息也会随之消失。

在这里插入图片描述

在常规的测试过程中,通常会关闭dropout机制。当拥有经过训练的模型并面对新的样本时,不再对节点实施dropout操作,因此无需进行归一化处理。然而,也存在一些特殊情况:部分研究者在测试阶段采用dropout作为一种启发式手段

全部评论 (0)

还没有任何评论哟~