Train Vision Transformers in Image Retrieval tasks.
发布时间
阅读量:
阅读量
展现出SOTA水平!其性能超越了ProxyNCA++、XBM等网络结构,实验结果显示出,相较于传统的卷积方法,Transformer架构在多个方面实现了稳定且明显的提升!
Transformer在视觉领域持续发力!近期又涌现出一批关于视觉Transformer的研究成果(多数出自知名企业和顶尖高校)。
注2:内容整理不易,欢迎点赞,支持分享!
Training Vision Transformers for Image Retrieval

- 作者单位:Facebook, ENS/Inria
在自然语言理解及近期的图像分类任务中,Transformers架构展现出了卓越的性能表现。
本文在此基础上进一步拓展研究内容,提出了一种依托Transformer结构的图像检索技术方案:通过引入视觉Transformer模型生成图像特征描述符,并基于度量学习的目标函数对模型进行训练,该目标函数融合了对比损失与差分熵正则化项。

还没有任何评论哟~
