Facebook开发:视觉Transformer模型用于图像检索系统
发布时间
阅读量:
阅读量
展现出SOTA水平!其性能超越了ProxyNCA++、XBM等网络结构,实验结果清晰地显示,相较于传统卷积方法,Transformer架构实现了稳定且明显的性能提升!
Transformer在视觉领域持续发力!近期又涌现出一批关于视觉Transformer的研究成果(主要来自行业巨头及顶尖高校)。
注2:内容整理不易,欢迎点赞并积极分享!
Training Vision Transformers for Image Retrieval

- 作者单位:Facebook, ENS/Inria
在自然语言理解及近期的图像分类任务中,Transformers架构展现出了卓越的表现。
本研究在此基础上进行拓展,提出了一种基于Transformer模型的图像检索技术方案:通过引入视觉Transformer生成图像特征表示,并以度量学习的目标函数对模型进行训练,该目标函数融合了对比损失与差分熵正则化项。

还没有任何评论哟~
