Advertisement

Targeting Transformer-Based ObjectDetection

阅读量:

不同于基于DETR及其变体的传统方法,在本文中我们提出了一种融合ViT和RPN的新架构。其中将传统的CNN主干网络替换成了transformer架构,并命名为ViT-FRCNN模型。这一创新设计可被视为纯transformer架构在复杂视觉任务中的关键里程碑之一(如目标检测)。

注:文末附【Transformer】和【目标检测】学习交流群

Toward Transformer-Based Object Detection

在这里插入图片描述

背景

在NLP领域中,Transformers被视为主流模型的原因在于它们能够通过对大量数据的预训练,并通过微调将知识转移到更小且更具体的任务上。

该研究团队将传统的transformer架构创新性地应用于图像数据处理领域,并将其命名为Vision Transformer(ViT),标志着基于transformer模型在视觉任务中的初步探索。研究表明,在标准分类基准测试中,基于transformer架构

全部评论 (0)

还没有任何评论哟~