Advertisement

CVPR2022 Mobile-Former: Bridging MobileNet and Transformer

阅读量:
在这里插入图片描述

论文相关资源链接:https://arxiv.org/pdf/2108.05895.pdf
对应实现代码:暂未提供

研究动机与背景分析

vision transformer (ViT)在全局信息建模方面表现出色,能够实现相较于CNN而言更为显著的性能提升。然而,在计算资源有限的情况下,ViT所带来的优势会有所减弱。针对计算成本这一难题,MobileNet及其衍生模型依旧保持着主导地位,这主要归因于它们在局部处理过滤器中通过分解深度卷积与点卷积而展现出的高效性。由此引发了一个关键问题:是否存在一种高效的网络架构,能够同时有效捕捉局部特征与全局交互关系?尽管已有研究尝试融合卷积与视觉Transformer的优势并取得了良好效果,但这些方法大多采用的是将两者进行串联的方式。那么,若采用并联结构,其性能表现又将如何呢?

2. 贡献

  • 本文将设计模式由串联结构调整为并联结构,并构建一种新型网络架构,该架构将MobileNet与Transformer进行并联连接,并在二者之间设置双向桥梁,此网络被命名为Mobile-Former,其中

全部评论 (0)

还没有任何评论哟~