Generative Data-free Quantization——生成式无数据量化方法
发布时间
阅读量:
阅读量
0. 前言
为实现深度学习模型在边缘设备及移动终端的部署,模型量化 已逐渐成为关键的模型压缩技术。首先,将模型权重转换为低比特表示 ,有助于减轻模型存储压力(如INT8量化可带来理论上的4倍压缩比例);其次,同时对权重与激活值进行低比特量化处理 ,可通过专用整数运算单元或硬件加速指令提升网络推理速度(例如NV GPU中的TensorCore),并有效降低运行时内存占用。
模型量化主要分为QAT与PTQ两类实现路径, 其中QAT需要依赖训练集进行感知微调(需为前向传播阶段设计具有低量化误差特性的量化器 ,并在反向传播阶段引入用于缓解梯度偏差的估计器设计策略 )。而PTQ属于训练后量化方法,涵盖无数据依赖与无标签依赖两种形式。由于用户隐私及数据安全问题,多数实际场景仅提供少量未标注数据以支持无标签PTQ方案(Label-free PTQ) ,或完全不提供数据仅支持无数据PTQ方法(Data-free PTQ) 。对于无数据量化的实现方式,通常需要借助预训练模型所包含的信息完成高效压缩,在保证精度的前提下尽量减少信息丢失。典型代表即为基于生成机制的策略——即所谓生成式方法(Generative Method) 。此类方法通过构造接近真实分布的数据样本作为量化基础,并结合优化算法调整参数、微调
全部评论 (0)
还没有任何评论哟~
