Quantifying and Mitigating Unimodal Biases in Multimodal Large Language Models: A Causal Perspective
发布时间
阅读量:
阅读量
本篇文章属于LLM系列内容,主要涉及对《从因果角度量化与缓解多模态大语言模型中的单模态偏差》这一文献的译介工作。
从因果关系的角度量化和减轻多模态大语言模型中的单模态偏误
- 摘要
- 1 引言
- 2 因果模型结构
- 3 构建MORE数据集
- 4 在MORE数据集上对MLLMs进行评估
- 5 缓解MLLMs在VQA任务中的偏差问题
- 6 相关研究综述
- 7 结论与总结
- 8 研究存在的不足与限制
摘要
大型语言模型(LLM)的最新突破推动了多模态LLM(MLLM)的演进。虽然MLLMs展现出令人瞩目的性能,但其在面对复杂多模态任务时,往往因过度依赖单一模态所携带的偏见(如语言或视觉偏见),而产生错误的输出结果。为深入探讨这一问题,我们构建了一个因果分析框架,用以揭示视觉问答(VQA)任务中所存在的偏见现象。在该框架下,我们构建了一个因果图模型,用于解析MLLMs在处理VQA问题时的预测机制,并借助深入的因果推理方法评估偏差对结果的影响。基于该因果图的设计理念,我们创建了一个名为MORE的新数据集,其中包含12000个VQA实例。该数据集旨在对MLLM进行更具挑战性的测试,要求其具备多步骤推理能力,并能够有效克服单一模态带来的偏差问题。此外,我们还提出了两种有效策略以缓解单峰偏差并提升MLLM的推理表现:一种是适用
全部评论 (0)
还没有任何评论哟~
