84.7:BoTNet:计算机视觉领域的瓶颈型Transformer
发布时间
阅读量:
阅读量
一种基于Transformer架构的新型网络结构近期问世!在ImageNet数据集上,其top-1准确率高达84.7%,表现优于SENet、EfficientNet等现有模型。将该模型拓展至目标检测、实例分割等多个下游任务中,显著提升了相关性能指标。目前该模型的实现代码即将公开,相关实验设计也已十分完备!
注1:文末附有【Transformer

- 作者单位:UC Berkeley, 谷歌
本文提出了一种名为BoTNet的新型骨干网络架构,其设计简洁但功能强大,能够将自注意力机制有效应用于多种计算机视觉任务,例如图像分类、目标检测以及实例分割。该方法仅在ResNet结构的最后三个bottleneck模块中,将原本的空间卷积操作替换为全局自注意力机制,而其他部分则保持不变。通过这种方式,所提出的方案在实例分割和目标检测任务中显著提升了基线性能,并且在减少模型参数数量的同时,有效降低了计算延迟。

还没有任何评论哟~
