Transformer (《Attention is all you need》)
发布时间
阅读量:
阅读量
2017年,Google机器翻译团队发布了一篇论文,介绍了一种全新的网络模型——Transformer。该模型采用纯粹的注意力机制作为核心,彻底摒弃了传统的RNN和CNN结构,在机器翻译任务中表现出了优异的性能。
目录
1 引言
2 背景
3 模型架构
3.1 编码器与解码器的堆叠结构
编码器:
解码器:
3.2 注意力机制
3.2.1 缩放点积注意力
3.2.2 多头注意力
3.2.3 注意力机制在本模型中的应用
3.3 位置感知前馈网络
3.4 嵌入层与Softmax函数
3.5 位置编码
4 自注意力机制的必要性
1 引言
RNN作为一种序列模型,其设计初衷在于维持ht-1至ht之间的时序关联,但由于这一特性导致难以实现并行运算。当序列长度较短时,早期信息往往容易被后续计算所忽略。
Attention机制能够有效捕捉序列模型内部的依赖关系,通常与RNN结合使用以增强模型性能。
本研究提出了一种无需递归操作的Transformer模型,该模型完全基于注意力机制来刻画输入与输出之间的全局依赖。相较于传统方法,Transformer具备更高的并行处理能力,在配备8个P100 GPU的计算环境下,仅需12小时的训练时间即可显著提升翻译质量。
2 背景
CNN具备并行运算能力,但若需表达两个输入或输出间的关联性,则需要通
全部评论 (0)
还没有任何评论哟~
