Advertisement

深入浅出的Attention和Transformer

阅读量:

本文旨在阐述attention机制及其在transformer模型中的应用。目前网络上存在大量关于这一主题的博客文章,然而多数内容仅是对原始论文的简单复述,缺乏深入分析与通俗表达。本文在借鉴相关博客及原始文献的基础上,结合自身见解,力求以更加详尽且易懂的方式解析attention机制与transformer模型的原理。

Attention in RNN

2014年,Bengio等人在其Neural machine translation by jointly learning to align and translate中首次引入了Attention机制。传统RNN在t时刻的输入由h(t-1)与x(t)共同构成,而编码器在处理完整输入序列后,会生成一个能够表征整个输入序列的特征表示。解码器在生成输出序列时,则会将该特征表示与前一时刻的解码结果作为输入。然而,在处理长句翻译任务时,解码器往往并不需要关注整个输入句子,而是仅对输入序列中的某些局部特征感兴趣。因此,Bengio等人提出了Attention机制,旨在学习输入序列与输出序列之间的对齐关系以及翻译关系。具体而言,在编码阶段,原始句子会被转化为一组特征向量;而在解码阶段,每个时间步都会从这些特征向量中选取一部分作为当前解码结果的依据。模型的整体架构

全部评论 (0)

还没有任何评论哟~