Bottleneck Transformers in Visual Recognition
发布时间
阅读量:
阅读量
一种基于Transformer架构的新型网络结构近期问世!在ImageNet数据集上的top-1准确率达到了84.7%,其表现优于SENet、EfficientNet等现有模型。该模型被成功应用于目标检测与实例分割等多个下游任务中,显著提升了相关性能指标。目前相关代码即将公开发布,实验部分也已进行得非常充分!
注1:文末附有【Transformer

- 作者单位:UC Berkeley, 谷歌
本文提出了一种名为BoTNet的新型backbone结构,该设计以简洁性与高效性为特点,成功地将自注意力机制引入到多个计算机视觉任务之中,例如图像分类、目标检测以及实例分割等。通过在ResNet模型的最后三个bottleneck blocks中,将原本的空间卷积操作替换为全局自注意力模块,而其余部分保持不变,该方法在实例分割与目标检测任务中有效提升了基准性能,并且在参数数量上有所减少,从而实现了对计算延迟的优化。

还没有任何评论哟~
