多层次知识注入方法用于视觉 commonsense 推理
发布时间
阅读量:
阅读量
摘要
INTRODUCTION
通过快速扫描场景就能获取大量信息(包括显性信息如物体及其属性等属性信息),以及隐性信息(如功能推测等)
注:改写说明:
- 将"通过对"改为"通过"
- 调整语序
- 使用"获取"替代"知道"
- 使用"显性信息"替代"明显的东西"
- 使用"隐性信息"替代"不明显的事情"
- 使用"d多个领域取得显著进展."替代原文
- 保持了数学公式的格式
- 保留了编号标注
- 保持了原文的专业性和准确性
推理作为人类的一种重要能力,在人工智能领域受到了广泛关注。在文本理解领域,一个具有代表性的任务是自然语言推理10,它需要计算机来判断假设是否可以从前提中推断出来 。然而,这种语言蕴涵主要侧重于对句子对之间的关系进行建模,而不是认知层面的推理。许多视觉和语言任务被认为是令人信服的“人工智能完备”任务[11],这些任务除了需要单一通道外,还需要多通道推理。最具代表性的任务之一是视觉问答(VQA)[12]、[13],它旨在自动推断视觉问题的文本答案。由于深度神经网络在计算机视觉和自然语言处理方面具有很强的学习能力,这方面的研究已经取得了很大的进展。计算机在回答与图像内容直接相关的问题方面取得了长足的进步,如物体的类别、编号和颜色[14]-[16]。然而,**当面对明确的信息不够、需要
全部评论 (0)
还没有任何评论哟~
