MetaTransformer is ViT standard model structure
发布时间
阅读量:
阅读量
Paper地址:https://arxiv.org/abs/2111.11418
GitHub-repository/sail-sg/poolformer: Where MetaFormer Proves Its Value in Vision Tasks (CVPR 2022 Oral Presentation)
方法
在主流Vision Transformer架构中(ViT)的核心模块体系整合了Masked Self-注意力(MSA)与前馈网络(FFN)组件。值得注意的是,在这一架构中(ViT),其关键组成部分——Masked Self-注意力机制负责对Tokens间的关联关系建立,并通过这一过程实现对Context信息的有效编码。基于其普遍作用特性,在这一过程中可以将其抽象为一种统一的特征混合操作——即所谓的Token mixer 。基于这一核心机制的一般化特性确立了 Vision Transformer 的标准架构模型体系框架图展示的就是该标准架构的具体构成形态

经典的Token mixer可划分为Attention-based modu
全部评论 (0)
还没有任何评论哟~
