Transformer端侧模型压缩——Mobile Transformer(Python版本)
发布时间
阅读量:
阅读量
在自然语言处理及自动语音识别等序列建模任务中,Transformer模型的广泛应用推动了其在端侧等资源受限环境下的部署需求持续增长。传统的小型化Transformer架构,如evolved transformer、lite-transformer、mobile-bert以及miniLM等,通过结构优化与知识蒸馏等多种手段,成功实现了模型体积的压缩,同时保障了模型在精度和稳定性方面的表现。
1. The Evolved Transformer
Paper Link: https://arxiv.org/abs/1901.11117
GitHub: https://github.com/tensorflow/tensor2tensor/blob/master/tensor2tensor/models/evolved_transformer.py
由Google研发的基于NAS搜索方法所获得的Transformer架构:
- 搜索范围:该结构包含两个可堆叠的单元,分别应用于Transformer编码器与解码器之中。每个单元均由NAS风格的模块构成,能够通过左右两侧的模块对输入嵌入进行转换,并进行聚合操作以生成新的嵌入表示,随后将其传递至自注意力层。
- 搜索方式:采用EA(进化算法)作为搜索机制;
网络架构如下:

还没有任何评论哟~
