Advertisement

end-to-end transformer model's mixed-precision quantization

阅读量:

针对端到端Transformer模型实施混合精度后量化技术,需解决以下关键问题:

  1. Transformer自回归结构由Encoder与Decoder组成;在对端到端模型进行压缩处理时,需兼顾自回归机制(如Beam Search)的复杂实现;
  2. 在执行后量化过程中,应选择合理且高效的PTQ策略(PTQ: Post-training Quantization),以保障量化后的模型具备良好的精度稳定性;
  3. 混合精度的决策过程需注重实现效率,通常采用无需标注数据的Label-free方法;

具体可参考端到端语音识别的移动端解决方案(淘系技术部官方文章)、以及[阿里云官方技术解读](https://developer.aliyun.com/article/781807 "阿里云官方技术解读"

全部评论 (0)

还没有任何评论哟~