Matryoshka Multimodal Models
发布时间
阅读量:
阅读量
本篇文章属于LLM系列内容,主要涉及对《Matryoshka Multimodal Models》一文的译介工作。
Matryoshka多模态模型架构解析
- 摘要
- 1 引言
- 2 相关研究
- 3 M^3:Matryoshka多模态模型
- 4 实验分析
- 5 结论与后续研究方向
摘要
大型多模态模型(LMM),例如LLaVA,在视觉语言推理任务中展现出卓越的能力。此类模型首先将图像转化为一组固定的大量视觉标记,随后将其输入至大型语言模型(LLM)中进行处理。然而,这种架构在面对高分辨率图像或视频等密集型视觉场景时,往往导致token数量激增,从而影响整体处理效率。尽管已有token修剪与合并的策略被提出,但这些方法通常为每个图像生成固定长度的输出,并无法在信息密度与处理效率之间实现灵活的平衡。受俄罗斯套娃概念的启发,我们提出了一种新型模型M^3:Matryoshka多模态模型,该模型通过学习将视觉内容表示为嵌套结构的视觉标记集合,从而捕捉从粗粒度到细粒度的多层次信息。我们的方法为LMM带来了多项显著优势:(1)在推理阶段能够对每个测试样本的视觉粒度进行显式控制,例如根据内容复杂程度或简单程度动态调整所使用的token数量;(2)M^3提供了一个分析现有数据集所需粒度水平的框架,在此框架下我们发现COCO __ 风格
全部评论 (0)
还没有任何评论哟~
