Advertisement

Need explicit position encodings for Vision Transformers

阅读量:

本文引入了一种名为CPVT的新架构:基于条件Position encoding的视觉Transformer模型。该模型能够轻松应对各种长度的输入序列,在性能方面优于包括DeiT、ViT在内的相关网络。其中PEG模块能够无缝整合到现有体系中,并展现出良好的兼容性与扩展性。

Do We Really Need Explicit Position Encodings for Vision Transformers?

大多数视觉领域中的Transformer架构(如ViT和DeiT)通过预定义的位置编码来整合每个输入token的位置信息。

在这里插入图片描述

在本文的研究工作中提出了基于条件位置编码的方法,在此方案下以输入token的局部邻域作为条件进行建模。这一方案得以轻松实现为我们所称谓的Position

全部评论 (0)

还没有任何评论哟~