视觉Transformers中的Position Encodings是否有必要使用?
发布时间
阅读量:
阅读量
该方法提出了一种名为CPVT的新架构:作为条件Position encoding视觉Transformer设计,在处理长短不一的输入序列方面表现出色;其中PEG模块能够无缝集成到现有框架中,并且其性能优于现有的相关网络性能。
Do We Really Need Explicit Position Encodings for Vision Transformers?
- 代码库:该代码库位于美团自动驾驶人工智能实验室。
- 论文预印本链接:该论文的预印本可通过ArXiv平台访问。
- 所属机构:美团在美团实验室及阿德莱德大学的支持下。
- 美团, 阿德莱德大学
大多数视觉Transformer架构(如ViT和DeiT)通过预定义的位置编码机制来整合每个输入token的空间位置信息。

在本文中, 我们提出了一种基于输入token局部邻域的条件Position编码方案. 该方案得以简便实现, 并且可以通
全部评论 (0)
还没有任何评论哟~
