Advertisement

视觉Transformers中的Position Encodings是否有必要使用?

阅读量:

该方法提出了一种名为CPVT的新架构:作为条件Position encoding视觉Transformer设计,在处理长短不一的输入序列方面表现出色;其中PEG模块能够无缝集成到现有框架中,并且其性能优于现有的相关网络性能。

Do We Really Need Explicit Position Encodings for Vision Transformers?

大多数视觉Transformer架构(如ViT和DeiT)通过预定义的位置编码机制来整合每个输入token的空间位置信息。

在这里插入图片描述

在本文中, 我们提出了一种基于输入token局部邻域的条件Position编码方案. 该方案得以简便实现, 并且可以通

全部评论 (0)

还没有任何评论哟~