CVPR 2019 | SP_相似性保持知识蒸馏
发布时间
阅读量:
阅读量
1.保持相似性知识蒸馏(SPKD)
本文探讨了一种创新性的知识蒸馏形式。该方法源于作者观察到:相同语义的输入会生成相似神经网络激活模式的现象。通过图示可以看出整个学习流程,在每个batch周期内:给定当前batch大小为b,在输入样本中计算成对样本之间的相似度矩阵;随后利用教师网络与学生网络间的相似度矩阵进行损失计算以指导学习过程。值得注意的是,在这种蒸馏方式中:我们模仿了PKT那种基于概率分布的知识提取机制;但个人认为本文提出的SPKD方法更具优势:基于概率分布的方式更适合于网络训练机制

2.相似性编码矩阵
为提出蒸馏学习方案所基于的前提是:若两个输入在教师网络中的激活输出高度相似,则应期望学生网络在此目标方向上表现出类似的响应特性;反之,在教师模型中对不同类别的输入施加不同激活的情况,则希望学生网络也能反映出这种分类差异。如图所示,在CIFAR-10数据集上经过训练的WideResNet-16-1与WideResNet-40-2
全部评论 (0)
还没有任何评论哟~
