Advertisement

多模态视觉大模型(1):大模型的架构

阅读量:

文章结构概览

    • 1.多模态大模型概述
        • 1.1 多模态概念界定
        • 1.2 多模态大模型的分类
        • 1.3 GPT-4V 的性能表现
      • 2.多模态网络结构

1.多模态大模型介绍

1.1 多模态定义

多模态这一概念主要指代输入数据所包含的不同类型,这些数据可以是文本、视频、音频等多种形式,同时还涵盖各类表格、json格式文件、图像以及来自各类传感器采集的数据。

在深度学习领域,传统的模式通常采用单模态的训练方式,即针对每一种数据类型或每一个具体任务,都需要构建并训练一个独立的模型。然而,从人类感知外部世界的角度来看,我们往往同时依赖多种感官信息进行理解。例如,在观看视频时,人们会同时接收图像、声音以及字幕等多方面的信息,这些信息分别对应图像、音频和文字三种不同的模态。而这三种模态之间具有一定的互补性,如在听不清某些语音内容时,可以通过字幕来辅助理解。因此,在深度学习的研究中,越来越多的学者开始关注并投入到多模态训练范式的探索之中。

1.2 多模态大模型的类型

多模态技术主要涵盖以下三种形式:

  • (1): 输入与输出模态存在差异:例如当前广受关注的文图生成技术,其本质是借助文本内容生成图像。同样地,也可以通过图像生成对应的文本描述,使网络输出

全部评论 (0)

还没有任何评论哟~