Advertisement

[Swin Transformer] Swin Transformer: Hierarchical VisionTransformer with shifted windows

阅读量:
image-20210403104347919

1. Motivation

将Transformer模型从自然语言处理领域拓展至计算机视觉领域面临两个主要难题,即视觉对象在尺度上的广泛差异性,以及图像像素相较于文本词汇所具有的更高分辨率特性,这将导致较大的内存消耗。

适应Transformer从语言到视觉任务的过程中所遇到的挑战源于两个领域的差异性,例如视觉实体在尺度上的显著变化,以及图像像素相较于文本单词所具有的更高分辨率特征,这会引发较大的内存开销。

本文作者旨在拓展Transformer的应用范围,使其能够作为通用的基础架构,广泛应用于计算机视觉领域。

在本研究中,我们致力于提升Transformer的适用性,使其能够像其在自然语言处理中的应用一样,在计算机视觉领域中作为通用的基础架构发挥作用,就如同卷积神经网络在该领域中的地位。

图1展示了VIT与本文提出的Swin Transformer之间的差异。

![image-20210403105152384](https://ad.itadn.com/c/weblog/blog

全部评论 (0)

还没有任何评论哟~