Advertisement

一文读懂「MLLM,Multimodal Large Language Model」多模态大语言模型

阅读量:
在这里插入图片描述

一. 什么是多模态?

模态作为事物的一种表达方式,多模态则指包含两个或两个以上不同模态的组合形式,其本质是通过多个维度对同一对象进行描述。在日常生活中,多模态的表现形式十分常见,例如传感器采集的数据不仅涵盖文字与图像信息,还可能包括对应的温度、深度等附加数据。借助多模态数据的融合,能够使对象的特征表现得更为丰富和完整。因此,围绕多模态的研究已成为当前学术领域的重要课题,并在情感分析、机器翻译、自然语言处理以及生物医药等前沿方向实现了诸多关键性进展。

1.研究背景与现状分析

在这里插入图片描述
  1. Transformer架构突破了传统模型的局限性,但其应用范围主要局限于单模态领域
  2. ViT的问世打破了计算机视觉与自然语言处理之间的界限,促进了多模态技术的发展,其中ViT所采用的Patch embedding方法在视觉特征提取方面展现出显著的效率

全部评论 (0)

还没有任何评论哟~