Explicit Incorporation of Visual Reasoning
发布时间
阅读量:
阅读量
Abstract
现有的可解释的和显式的视觉推理系统仅限于依赖视觉证据的推断而不整合外部知识 。鉴于此,在真实世界图像语义与视觉推理方法之间的知识鸿沟问题上我们进行了深入研究并在此领域首次提出了一种显式视觉推理系统 该系统通过融合外部知识并建模高阶关系以显著提升了其泛化能力与可解释性 。具体而言我们构建了一个实体与谓词融合网络 这一网络能够从外部知识库中显式地创建并包含新的图节点从而丰富用于显式推断的场景图语义 。随后我们设计了一个新的关联模块专门处理这些丰富的场景图以聚焦高阶关系关注 通过系统性地引入结构化的外部知识 和高阶关系关注机制 我们的实验结果表明该方法在GQA与VQAv2数据集上展现出卓越的泛化性能与清晰的可解释性
Introduction
视觉问答致力于针对视觉场景提出的自然语言问题进行解答。这是一个耗时的任务,要求参与者不仅需熟练掌握视觉信息处理能力,还需具备解答开放性领域问题所需的知识储备。尽管深度神经网络(DNN)展现出极强的能力,但目前基于DNN实现的视觉问答(VQA)系统主要依赖于问题与答案之间表面相关性的机制,犹如黑匣子般运作[2]。因此,这类模型在处理复杂推理任务时往往显得力不从心,尤其是在需要多步推理以获得完整答案的情况下表现尤为明显:它们不仅缺乏普遍适用性和解码能力,而且难以对决策过程做
全部评论 (0)
还没有任何评论哟~
