一文读懂「MLLM,Multimodal Large Language Model」多模态大语言模型
发布时间
阅读量:
阅读量

一. 什么是多模态?
模态作为事物的一种表达方式,多模态则指包含两个或两个以上不同模态的组合形式,其本质是通过多个维度对同一对象进行描述。在日常生活中,多模态的表现形式十分常见,例如传感器采集的数据不仅涵盖文字与图像信息,还可能包括对应的温度、深度等附加数据。借助多模态数据的融合,能够使对象的特征表现得更为丰富和完整。因此,围绕多模态的研究已成为当前学术领域的重要课题,并在情感分析、机器翻译、自然语言处理以及生物医药等前沿方向实现了诸多关键性进展。
1.研究背景与现状分析

- Transformer架构突破了传统模型的局限性,但其应用范围主要局限于单模态领域
- ViT的问世打破了计算机视觉与自然语言处理之间的界限,促进了多模态技术的发展,其中ViT所采用的Patch embedding方法在视觉特征提取方面展现出显著的效率
全部评论 (0)
还没有任何评论哟~
