CVPR 2019 | VID 最大化互信息蒸馏知识
发布时间
阅读量:
阅读量
CVPR 2019 | Variational Information Distillation for Knowledge Transfer
https://github.com/qiu931110/RepDistiller
1.互信息
本文中,研究者设计出一种创新的知识蒸馏方式,该途径将知识蒸馏的最佳表现界定为提升教师模型与学生模型之间互信息的最大化程度。那么,为何通过增强互信息能够促使蒸馏过程更加高效?首先,作者对互信息给出了如下界定:

根据前述公式可知,互信息的计算方式为[教师模型的熵值]减去[在学生模型已知条件下的教师模型熵值]。在此基础上,存在一个普遍认知:当学生模型的信息已知时,教师模型的熵值将显著降低,这表明学生模型已经掌握了能够还原教师模型所需的关键“压缩”信息,从而间接反映出学生模型的学习效果已达到较高水平。在这一情形下,上述公式中的H(t|s)数值将变得极小,进而导致互信息I(t;s)呈现出较大的数值。基于这一原理,作者从该角度阐释了为何可以通过最大化互信息的方式来实现知识
全部评论 (0)
还没有任何评论哟~
