Need explicit position encodings for Vision Transformers
发布时间
阅读量:
阅读量
本文引入了一种名为CPVT的新架构:基于条件Position encoding的视觉Transformer模型。该模型能够轻松应对各种长度的输入序列,在性能方面优于包括DeiT、ViT在内的相关网络。其中PEG模块能够无缝整合到现有体系中,并展现出良好的兼容性与扩展性。
Do We Really Need Explicit Position Encodings for Vision Transformers?
- 代码:官方GitHub存储地址为https://github.com/Meituan-AutoML/CPVT
- 论文下载链接:官方学术论文下载链接为https://arxiv.org/abs/2102.10882
- 作者单位:所属机构分别为美团科技有限公司及阿德莱德大学
大多数视觉领域中的Transformer架构(如ViT和DeiT)通过预定义的位置编码来整合每个输入token的位置信息。

在本文的研究工作中提出了基于条件位置编码的方法,在此方案下以输入token的局部邻域作为条件进行建模。这一方案得以轻松实现为我们所称谓的Position
全部评论 (0)
还没有任何评论哟~
