GQA: New Dataset for Real-World Visual Reasoning & Composition Question Answering
发布时间
阅读量:
阅读量
GQA:一个用于真实世界视觉推理和合成问题回答的新数据集
我们开发了一个新的数据集GQA(Generic Question Answer),专门用于真实世界视觉推理与合成问题的回答。我们的目标是改进现有VQA(Visual Question Answer)数据集的主要局限性。为此我们设计并构建了一个强大的鲁棒性问题引擎它能够利用视觉基因组场景图结构生成多达220万种不同的推理问题这些问题均具备表示其语义的功能程序通过这些程序我们可以精确控制答案分布并引入一种新型可调平滑技术以缓解这些问题带来的偏差影响。伴随着这一系列高质量的问题生成器我们将发布一套新的评估标准这套标准聚焦于衡量一致性基础性和合理性等多个关键指标旨在全面评估模型性能并进行细致对比分析包括基线模型在内的多个基准模型的表现结果本研究还特别关注了不同问题类型及其拓扑结构对模型性能的影响通过系统地评估这些因素我们可以更好地理解影响其表现的主要原因并据此优化现有架构设计未来的研究工作将基于这一创新性的数据集框架探索更多可能性从而推动视觉与语言交互领域的进一步发展
不仅仅是凭借直觉或猜测 也能给出出色答案。 通过运用已有的知识进行推断的能力是人工智能的核心领域之一。 该目标的具体体现体现在虚拟问题回答(VQA)的任务中,在该任务中系统需通过对呈现信息的深入分析来进行自由形式的问题解答。 所需能力包括但不限于对象识别、
全部评论 (0)
还没有任何评论哟~
