Advertisement

深度学习基础模型InceptionV2BN

阅读量:

深度神经网络的训练过程面临诸多挑战,其中一大关键因素在于各层输入数据的分布会在训练过程中持续发生变化,这种变化源于前序层参数的不断调整。

在训练过程中,网络结构必须持续适应由输入数据分布变化所引发的动态调整。

随着网络深度的增加,训练难度也随之上升,对此可采取以下优化策略:

  • 激活函数:传统如sigmoid和tanh等函数存在饱和现象,影响模型性能。为此,Hiton提出ReLU函数,在反向传播中有效缓解了梯度消失问题
  • Batch Normalization:归一化处理(本文内容)
  • Residual Network:通过引入skip connection(即恒等映射),实现低层信息与高层信息之间的直接连接,从而增强模型表达能力

出发点

论文起初阐明了采用mini-batch SGD所带来的优势:

复制代码
    - batch越大,效果越好
    - m个样本并行计算,要比m个样本单独计算,效率要高很多
    
    
      
      
    

随后揭示了SGD所存在的不足之处:

复制代码
    - 模型的超参数,非常难调优:需要对初始值和学习率非常细致的tune,难度比较大
    
    
      
    

进一步探讨后,可明确调优难度较大的根源所

全部评论 (0)

还没有任何评论哟~