Rethinking Kullback-Leibler Divergence in Knowledge Distillation for Large Language Models
发布时间
阅读量:
阅读量
本篇文章属于LLM系列内容,主要涉及对《Rethinking Kullback-Leibler Divergence in Knowledge Distillation for Large Language Models》这一文献的译介工作。
对大型语言模型知识蒸馏中Kullback-Leibler散度的再思考
- 摘要
- 1 引言
- 2 相关研究
- 3 序言与思考
- 4 技术手段
- 5 测试验证
- 6 全面探讨
- 7 总结归纳
摘要
Kullback-Leibler散度在知识蒸馏(KD)过程中被普遍应用于大型语言模型(LLMs)的压缩任务。与此前的观点相悖,即认为反向Kullback-Leibler(RKL)散度具备模式寻找特性,因而优于具有均值寻找特性的正向Kullback-Leibler(FKL)散度,本研究从实验和理论两个层面揭示,在LLM的知识蒸馏过程中既不存在模式寻找也不存在均值寻找的特性。相反,RKL与FKL被证实拥有相同的优化目标,并且在经过足够多的迭代次数后均可实现收敛。然而,由于现实中的训练条件限制,LLM通常不会经历如此漫长的训练周期。此外,我们进一步发现,RKL更关注分布的尾部区域,而FKL则侧重于分布的起始部分。因此,我们提出了一种简单且高效的自适应Kullback-Leibler(AKL)
全部评论 (0)
还没有任何评论哟~
