Advertisement

Bottleneck Transformers in Visual Recognition

阅读量:

一种基于Transformer架构的新型网络结构近期问世!在ImageNet数据集上的top-1准确率达到了84.7%,其表现优于SENet、EfficientNet等现有模型。该模型被成功应用于目标检测与实例分割等多个下游任务中,显著提升了相关性能指标。目前相关代码即将公开发布,实验部分也已进行得非常充分!

注1:文末附有【Transformer

在这里插入图片描述

本文提出了一种名为BoTNet的新型backbone结构,该设计以简洁性与高效性为特点,成功地将自注意力机制引入到多个计算机视觉任务之中,例如图像分类、目标检测以及实例分割等。通过在ResNet模型的最后三个bottleneck blocks中,将原本的空间卷积操作替换为全局自注意力模块,而其余部分保持不变,该方法在实例分割与目标检测任务中有效提升了基准性能,并且在参数数量上有所减少,从而实现了对计算延迟的优化。

![在这里插入图片描述](https://ad.itadn.com/c/w

全部评论 (0)

还没有任何评论哟~