Advertisement

Scaling vision transformers

阅读量:

本文改进了ViT的架构和训练,减少了内存消耗并提高了模型的准确性!最终成功训练了一个具有20亿参数的ViT模型:ViT-G,在ImageNet上达到了90.45%的 top-1准确率。

注1:文末附【视觉Transformer】交流群

想看更多CVPR 2021论文和开源项目可以点击:

CVPR2021-Papers-with-Code

ViT-G

Scaling Vision Transformers

在这里插入图片描述

凭借强大的技术实力,该成果得以顺利实现!

在这里插入图片描述

基于注

全部评论 (0)

还没有任何评论哟~