Advertisement

论文关于注意力机制的研究

阅读量:

本研究构建了一种创新的模型结构——Transformer。在该模型问世之前,机器翻译领域普遍采用的架构主要包括基础的Seq2Seq模型以及融合了注意力机制的改进型Seq2Seq模型。尽管Transformer与这些传统架构在整体框架上均包含编码器与解码器两个核心组件,但其显著区别在于未采用RNN/LSTM或CNN等序列处理模块,仅通过注意力机制便实现了输入与输出之间的并行计算。该模型的优势主要体现在以下几个方面:

  • 在传统Seq2Seq模型中,编码器会将输入序列压缩为一个固定维度的向量表示,所有语义信息均被整合于单一向量之中。然而,当输入序列较长时,这种方式容易导致大量语义信息的丢失。而Transformer有效克服了这一缺陷。
  • 常规的Seq2Seq架构及其引入注意力机制的变体由于依赖RNN/LSTM模块,在处理过程中无法实现输入与输出的并行操作(即编码器必须逐次读取所有输入内容后才能生成输出)。相比之下,Transformer成功解决了这一限制问题。

1.模型整体架构

在这里插入图片描述

如上图所示,文中介绍了一种名为Transformer的模型结构。从图示可以发

全部评论 (0)

还没有任何评论哟~