Advertisement

深入解析transformer模型

阅读量:

个人的阅读笔记,观看李宏毅老师的视频记录

基本概念

sequence代表序列

Embedding即为一种将高维数据映射到低维空间的技术,其实其本质是特征提取

Seq2Seq模型

以全名为"seq2seq"的模型架构设计是一种基于深度学习的方法框架

Seq2Seq模型的核心概念在于通过编码器将输入序列进行特征提取并生成中间表示 ,随后由解码器将其转化为与初始输入相对应的目标序列。其中编码器和解码器分别负责不同的功能模块:编码器处理输入信息并生成隐式表示 ,而解码器则根据此表示逐步构建输出结果。整个架构不仅支持多种类型的 recurrent neural networks (RNN)及其变体 ,还能够采用基于 attention 的 transformer 模型来进行处理 。

以下是Seq2Seq模型的工作流程:

编码器(Encoder):接收输入序列并对其进行编码为一个定长的上下文向量(Context Vector),这个Context Vector包含了输入信息经过压缩后的摘要。该编码器不仅能够接收并处理输入信息以生成Context Vector,还能够同时完成对信息序列的压缩和特征提取。

编码器(Encoder):接收输入序列并对其进行编码为一个定长的上下文向量(Context Vector),这个Context Vecto

全部评论 (0)

还没有任何评论哟~