Transformer 开篇:Self-attention with multi-head
发布时间
阅读量:
阅读量
论文:Transformer: Attention Is All You Need

Transformer最初是为了解决NLP领域中的问题而被提出的,在此之前,研究者们主要依赖于RNN、LSTM等时序模型。然而,这类网络存在一些缺陷,例如其记忆能力有限,尤其是RNN的记忆长度较短,因此后续提出了LSTM以改进这一问题。但这些模型仍面临另一个显著的不足,即无法实现并行计算。具体而言,在处理序列数据时,必须依次完成t_0时刻的计算之后,才能进行t_1时刻的运算。这种串行处理方式导致训练效率低下,给实际应用带来了诸多不便。
为应对上述挑战,Google研发了Transformer模型以取代传统时序网络。
- 在理论上,
Transformer不受硬件条件的限制,其记忆能力可以无限延伸。 - 另一方面,该模型支持并行化操作,这一特性被视为其核心优势之一。
理论基础构建
Self-Attention理论解析

还没有任何评论哟~
