深度学习:MSRA 初始化
发布时间
阅读量:
阅读量
以下将对MSRA初始化方法进行简要介绍,该方法源自何凯明在论文《Delving Deep into Rectifiers:Surpassing Human-Level Performance on ImageNet Classification》中提出的相关研究。
-
- 背景与动因
- MSRA初始化技术
- 数学推导与理论验证
- 进一步说明与补充内容
Motivation
网络初始化在深度学习过程中占据着至关重要的地位。然而,传统的基于固定方差高斯分布的初始化方式,在网络层数增加时往往会导致模型难以有效收敛。此外,VGG团队在应对初始化问题时采取了如下策略:他们首先完成了一个8层网络的训练,随后利用该网络的参数作为初始值,对更深的网络进行初始化。
“Xavier”方法是一种较为理想的初始化手段,我在另一篇博客“深度学习——Xavier初始化方法”中曾对此进行过详细阐述。不过,在Xavier方法的推导过程中假定激活函数为线性形式,而当前广泛使用的ReLU与PReLU等激活函数显然不符合这一前提条件。
MSRA初始化
当仅考量输入数量时,MSRA初始化方式所采用的高斯分布具有零均值与2/n的方差特征:
