ExplainableExplicitVisualReasoningOverSceneGraphs
发布时间
阅读量:
阅读量
Abstarct
我们致力于将复杂视觉推理任务中广泛采用的黑盒神经体系结构划分为所提出的可解释且显式神经模块(XNMs)。该模块在现有神经模块网络的基础上超越了其性能,并通过以场景图中的对象作为节点、以成对关系作为边的方式实现了利用结构化知识来进行可解释性和显式推理的目标。XNMs的独特之处在于它允许我们更加关注机器如何进行"思考"(即它们的行为模式),而无需在意它们"呈现时"的具体形态(即外观)。正如本文将展示的那样:首先,通过将场景图设定为归纳偏差的基础元素之一,在设计XNMs时我们可以做到简洁灵活——即仅由四种基本类型的元类型构成即可实现这一目标;其次,在这一框架下我们可以通过引入图注意力机制来明确追踪推理流程——从而显著地降低了参数数量(减少了10至100倍)并实现了对推理过程的关注度。此外,由于其通用性特征,XNMs能够适用于不同质量的场景图实现方式:例如,在图形精确检测的情况下,XNMs在clever和CLEVR CoGenT上均达到了100%的准确率,从而确立了视觉推理的经验性能上限;而在从嘈杂图像中模糊检测图形的情况下,XNMs依然能够在VQAv2.0上实现67.5%的竞争性准确率,这超过了当前流行的基于物体包注意力模型的方法。
Introduction
人工智能技术的蓬勃发展已在多个领域取得显著进展,在游戏[23]、语音识别[1]以及图
全部评论 (0)
还没有任何评论哟~
