Scaling vision transformers
发布时间
阅读量:
阅读量
本文改进了ViT的架构和训练,减少了内存消耗并提高了模型的准确性!最终成功训练了一个具有20亿参数的ViT模型:ViT-G,在ImageNet上达到了90.45%的 top-1准确率。
注1:文末附【视觉Transformer】交流群
想看更多CVPR 2021论文和开源项目可以点击:
ViT-G
Scaling Vision Transformers

- 作者所属机构:谷歌大脑(苏黎世),曾参与ViT论文并担任第一作者及第二作者
凭借强大的技术实力,该成果得以顺利实现!

基于注
全部评论 (0)
还没有任何评论哟~
