CVPR2020论文分析:视频语义研究
发布时间
阅读量:
阅读量
CVPR2020论文解析:视频语义检索
Fine-grained Video-Text Retrieval with Hierarchical
Graph Reasoning

论文链接:https://arxiv.org/pdf/2003.00392.pdf
摘要
在当今快速发展的网络环境中,在视频与文本关联性研究领域中获得了广泛关注的是一种称为"跨模态检索"的技术手段。传统的联合嵌入方法虽然在一定程度上能够反映多模态数据之间的相似关系,在复杂场景下(如不同场景、物体及其运动模式)往往难以有效捕捉这些细节特征。针对细粒度级联检索问题提出了一种层次图推理(HGR)模型。该模型首先将输入文本划分为多层次语义图结构:具体而言,在语义图构建阶段,我们首先将输入文本划分为事件层、行为层以及实体关联层三个基本层次。随后通过注意力机制引导图形推理过程,在各层之间建立有效的信息传递通道,并利用这种层级关系生成相应的表征向量。在此基础上设计了基于多级注意力机制的自监督学习框架,并在此框架下设计了新的评估指标以衡量各层级的表现情况。实验结果表明该方法在多个标准测试集上均表现优异
全部评论 (0)
还没有任何评论哟~
