Advertisement

MetaTransformer is ViT standard model structure

阅读量:

Paper地址:https://arxiv.org/abs/2111.11418

GitHub-repository/sail-sg/poolformer: Where MetaFormer Proves Its Value in Vision Tasks (CVPR 2022 Oral Presentation)

方法

在主流Vision Transformer架构中(ViT)的核心模块体系整合了Masked Self-注意力(MSA)与前馈网络(FFN)组件。值得注意的是,在这一架构中(ViT),其关键组成部分——Masked Self-注意力机制负责对Tokens间的关联关系建立,并通过这一过程实现对Context信息的有效编码。基于其普遍作用特性,在这一过程中可以将其抽象为一种统一的特征混合操作——即所谓的Token mixer 。基于这一核心机制的一般化特性确立了 Vision Transformer 的标准架构模型体系框架图展示的就是该标准架构的具体构成形态

经典的Token mixer可划分为Attention-based modu

全部评论 (0)

还没有任何评论哟~