Advertisement

Understanding Transformer

阅读量:

Transformer 是由 Google 团队的 Ashish Vaswani 等人于 2017 年 6 月在其发表的论文 Attention Is All You Need 中提出的一项经典研究成果,在NLP领域的一项具有里程碑意义的研究成果。该方法可以被视为近年来NLP领域的一项重大突破,在此之前的基于seq2seq架构加上注意力机制的方法已经展现出很强的效果。值得注意的是该方法完全摒弃了传统的RNN等序列处理架构,在其发布后立即引发了广泛关注,并且仅仅依靠注意力机制这一创新性组件就实现了超越现有主流模型(如RNN、CNN)在机器翻译任务上的性能水平。

图像信息来自

Transformer 和 RNN 比较

在机器翻译任务研究中发现,在Transformer之前采用的Encoder-Decoder + Attention架构已经展现出了良好的效果;但相比之下,在RNN架构上仍存在一定的缺陷。

  • 首先,在设计架构时发现RNN不具备高效的并行计算能力。这是因为RNN架构基于序列依赖特性,在执行当前状态计算时必须依赖于之前的全部状态信息,在

全部评论 (0)

还没有任何评论哟~