Advertisement

T2T-ViT is a self-supervised learning model for Vision Transformer training.

阅读量:

本文提出了一个新的Tokens到Token视觉Transformer(T2T-ViT)。该方法的性能较之更加卓越。通过将原始ViT的参数和MAC减少了一半,并展现出超越ViT及ResNet等主流网络的能力,在代码层面已正式开源。

昨天才发布了基于CNN+Transformer的新主干网络BoTNet:CNN+Transformer!谷歌提出BoTNet:新主干网络!在ImageNet上达84.7%,进一步探索计算机视觉领域的前沿方向……愈演愈烈的竞争态势……

Transformer

Transformer

不过这篇论文在目标检测与实例分割等下游任务上并未提供足够的实验数据支持。若能补充相关分析将更有裨益。鉴于此,'backbone'当前的表现尚不理想。

全部评论 (0)

还没有任何评论哟~