Advertisement

GraphVQA: Language-Guided Graph Neural Networks in Scene Graph Question Answering

阅读量:

基于场景图进行问答的语言引导图神经网络

图像不仅仅是由对象及其属性组成的集合,它们实际上体现了一个相互关联的对象关系网络。场景图作为图像的结构化图形表达方式,已经发展成为一种全新的呈现形式。在该结构中,物体被编码为通过成对边关系连接的节点,

为了实现基于场景图的问答任务,提出了一种名为GraphVQA的语言引导型图神经网络框架,该框架能够将自然语言问题转化为在图节点之间进行多次迭代的信息传递过程。我们对GraphVQA框架的设计空间进行了深入探索,分析了不同设计选项之间的权衡关系,并最终取得了优异的性能表现。

Introduction

图像不仅仅是由对象或属性组成的简单集合,其本质体现为对象之间相互关联的复杂网络结构。为了实现图像表示的形式化,Visual Genome(Krishna等人,2007a)提出了一种称为场景图的结构化图形表达方式,该方式与知识库中常用的形式化表达具有相似性。如图1所示,场景图通过将对象**(例如,女孩、汉堡)** 表示为节点,并以成对关系(例如,持有) 作为连接这些节点的边,从而构建出图像内容的结构化表达。目前,场景图已经被广泛应用于图像检索(Johnson等人,2015年)、图像生成(Johnson等人,2018年)、图像字幕(Anderson等人,2016年) 、教学视频理解(Huang等人,2018

全部评论 (0)

还没有任何评论哟~