VideoAgent: Long-form Video Understanding with Large Language Model as Agent
发布时间
阅读量:
阅读量
本篇文章属于LLM系列内容,旨在对《VideoAgent: Long-form Video Understanding with Large Language Model as Agent》这一文献进行语言转换处理。
VideoAgent:以大语言模型为Agent的长格式视频理解
- 摘要
- 1 引言
- 2 相关研究
- 3 技术手段
- 4 实验分析
- 5 总结
摘要
长格式视频理解作为计算机视觉领域的重要难题,亟需构建具备对长多模态序列进行推理能力的模型。受到人类在理解长视频过程中所采用的认知机制的启发,我们更加关注交互式推理与规划机制,而非单纯强调对长视频输入的处理能力。为此,我们提出了一种全新的基于代理架构的系统VideoAgent,该系统以大型语言模型为核心代理,通过迭代方式识别并整合关键信息以解答问题,并借助视觉语言基础模型作为辅助工具,实现对视觉信息的转换与检索。通过在具有挑战性的EgoSchema和NExT-QA基准数据集上的评估可以看出,在仅使用8.4和8.2帧图像的情况下,VideoAgent分别达到了54.1%和71.3%的零样本准确率。这些实验结果充分证明了相较于现有最先进方法,本方法在性能与效率方面均表现出明显优势,并进一步凸显了基于代理架构的技术路径在推动长格式视频理解研究中的广阔前景。
1 引
全部评论 (0)
还没有任何评论哟~
