(VQA)LRTA: A Transparent Neural-Symbolic Reasoning Framework with Modular Supervision for Visual Questions.
发布时间
阅读量:
阅读量
2020年发布的一篇文献
LRTA神经符号推理体系

当前视觉问答领域的主流技术方案主要依赖于“黑盒”神经编码器()对图像与问题进行编码处理,难以在预测过程中提供具有直观性且便于人类理解的论证形式。提出了一种名为LRTA(Look Read Think Answer)的模型,该模型模仿人类思维过程,分步骤完成问题求解,并在每个阶段生成可供人类阅读的论证内容。具体流程如下:1. 首先将输入图像转化为场景图;2. 接着将提出的问题拆解为多个推理指令;3. 利用循环神经符号执行模块对场景图进行遍历,逐条执行推理指令;4. 最终生成包含自然语言解释的完整答案。作者指出,相较于现有模型通常仅从训练数据中学习到表层关联,基于LRTA的框架则更进一步地推动了对问题本质的理解。
Introduction
当前VQA领域的主流技术方案主要依托于黑盒Transformer模型对图像信息与问题内容进行编码处理,此类方法在内部完成一系列复杂的运算过程,但最终仅输出单一标记作为预测结果(例如“是”或“否”),因此研究人员致力于构建能够与其预测结果相匹配的、具备直观性且易于人类理解的证明形式。

还没有任何评论哟~
