多模态视觉大模型(1):大模型的架构
发布时间
阅读量:
阅读量
文章结构概览
-
- 1.多模态大模型概述
-
- 1.1 多模态概念界定
- 1.2 多模态大模型的分类
- 1.3 GPT-4V 的性能表现
-
2.多模态网络结构
-
- 1.多模态大模型概述
1.多模态大模型介绍
1.1 多模态定义
多模态这一概念主要指代输入数据所包含的不同类型,这些数据可以是文本、视频、音频等多种形式,同时还涵盖各类表格、json格式文件、图像以及来自各类传感器采集的数据。
在深度学习领域,传统的模式通常采用单模态的训练方式,即针对每一种数据类型或每一个具体任务,都需要构建并训练一个独立的模型。然而,从人类感知外部世界的角度来看,我们往往同时依赖多种感官信息进行理解。例如,在观看视频时,人们会同时接收图像、声音以及字幕等多方面的信息,这些信息分别对应图像、音频和文字三种不同的模态。而这三种模态之间具有一定的互补性,如在听不清某些语音内容时,可以通过字幕来辅助理解。因此,在深度学习的研究中,越来越多的学者开始关注并投入到多模态训练范式的探索之中。
1.2 多模态大模型的类型
多模态技术主要涵盖以下三种形式:
- (1):
输入与输出模态存在差异:例如当前广受关注的文图生成技术,其本质是借助文本内容生成图像。同样地,也可以通过图像生成对应的文本描述,使网络输出
全部评论 (0)
还没有任何评论哟~
