Advertisement

Transformer 开篇:Self-attention with multi-head

阅读量:

论文:Transformer: Attention Is All You Need

在这里插入图片描述

Transformer最初是为了解决NLP领域中的问题而被提出的,在此之前,研究者们主要依赖于RNN、LSTM等时序模型。然而,这类网络存在一些缺陷,例如其记忆能力有限,尤其是RNN的记忆长度较短,因此后续提出了LSTM以改进这一问题。但这些模型仍面临另一个显著的不足,即无法实现并行计算。具体而言,在处理序列数据时,必须依次完成t_0时刻的计算之后,才能进行t_1时刻的运算。这种串行处理方式导致训练效率低下,给实际应用带来了诸多不便。

为应对上述挑战,Google研发了Transformer模型以取代传统时序网络。

  • 在理论上,Transformer不受硬件条件的限制,其记忆能力可以无限延伸。
  • 另一方面,该模型支持并行化操作,这一特性被视为其核心优势之一。

理论基础构建

Self-Attention理论解析

![在这里插入图片描述](https://c

全部评论 (0)

还没有任何评论哟~