Advertisement

Matryoshka Multimodal Models

阅读量:

本篇文章属于LLM系列内容,主要涉及对《Matryoshka Multimodal Models》一文的译介工作。

Matryoshka多模态模型架构解析

  • 摘要
    • 1 引言
    • 2 相关研究
    • 3 M^3:Matryoshka多模态模型
    • 4 实验分析
    • 5 结论与后续研究方向

摘要

大型多模态模型(LMM),例如LLaVA,在视觉语言推理任务中展现出卓越的能力。此类模型首先将图像转化为一组固定的大量视觉标记,随后将其输入至大型语言模型(LLM)中进行处理。然而,这种架构在面对高分辨率图像或视频等密集型视觉场景时,往往导致token数量激增,从而影响整体处理效率。尽管已有token修剪与合并的策略被提出,但这些方法通常为每个图像生成固定长度的输出,并无法在信息密度与处理效率之间实现灵活的平衡。受俄罗斯套娃概念的启发,我们提出了一种新型模型M^3:Matryoshka多模态模型,该模型通过学习将视觉内容表示为嵌套结构的视觉标记集合,从而捕捉从粗粒度到细粒度的多层次信息。我们的方法为LMM带来了多项显著优势:(1)在推理阶段能够对每个测试样本的视觉粒度进行显式控制,例如根据内容复杂程度或简单程度动态调整所使用的token数量;(2)M^3提供了一个分析现有数据集所需粒度水平的框架,在此框架下我们发现COCO __ 风格

全部评论 (0)

还没有任何评论哟~