随笔笔记:多模态信号的表征及应用
发布时间
阅读量:
阅读量
基本概述
深度学习模型(尤其是感知类模型) 接收的输入信号,主要涵盖图像、文本以及语音等多种类型的信息。这些不同形式的输入信号,在经过模型内部逐层的抽象与转换处理后,将被转化为不同层次的抽象表达(例如语义信息、表征形式或编码知识等),并进一步服务于各类具体的应用任务。

如上图所示,深度学习模型由前处理、浅层、深层、任务相关层以及后处理等多个阶段组成,各个阶段的输入与输出具有不同的意义,以下简要说明(以CNN模型为例进行图像信号处理,以BERT/Transformer模型为例进行语音和文本信号处理):
- 输入信号: 模型所接收的输入信号为原始数据或仅经过初步处理的数据(raw data),包括自然信号(如图像、语音)与人工信号(如文本);自然信号 通常含有噪声,并且信息冗余度较高,需借助全局或局部的相关性 来实现去冗余;而人工信号是人为定义的符号系统 ,其中包含一定的语义内容,通常需要结合上下文(Context)来准确理解其含义,并且模糊的表达容易引发歧义;
- 前处理: 对于自然信号 ,常见的操作包括
全部评论 (0)
还没有任何评论哟~
