HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
发布时间
阅读量:
阅读量
本篇文章属于LLM系列内容,主要涉及对《HyperLLaVA: Dynamic Visual __ and Language Expert Tuning for Multimodal Large Language Models》这一文献的译介工作。
HyperLLaVA:多模态大型语言模型的动态视觉和语言专家调整
- 摘要
- 1 引言
- 2 相关研究
- 3 技术手段
- 4 测试分析
- 5 总结归纳
摘要内容提炼
近期的研究成果显示,拓展多模态大型语言模型(MLLMs)能够有效增强各类多模态任务的表现。当前主流的MLLM架构,如LLaVA,通常借助固定的视觉语言映射机制,将图像特征转化为类文本的符号,从而使原本静态的LLM具备通过视觉指令进行调节、理解视觉内容的能力。然而,这种共享参数的固定调整方式虽具潜力,却可能对不同下游多模态任务的效果产生一定限制。针对这一问题,我们提出HyperLLaVA方案,该方法结合了动态视觉专家与语言专家模块,并引入投影及LLM参数的自适应调整机制。这些专家模块源自HyperNetworks技术,其能够依据视觉与语言信息生成对应的参数偏移量,在两阶段训练过程中实现动态投影与LLM建模。实验结果表明,在多个现有MLLM基准测试中,我们的方法在MME、MMBench、SEED Bench以及LLaVA B
全部评论 (0)
还没有任何评论哟~
