Advertisement

pytorch实现transformer(1): 模型介绍

阅读量:

文章结构概述

      1. Transformer 概述
      • 2 位置编码

        • 2.1 位置编码机制
        • 2.2 实现代码
      • 3 自注意力机制

      • 4 前馈神经网络层

      • 5 残差连接及层归一化处理

      • 6 编码器与解码器架构

1. transformer 介绍

Transformer 模型是由谷歌于 2017 年首次引入,并率先在机器翻译任务中得到应用的神经网络架构。机器翻译的核心目标在于将源语言转换为对应的目标语言。Transformer 架构通过注意力机制实现了对源语言序列与目标语言序列之间全局依赖关系的建模。目前,几乎所有大型语言模型均建立在 Transformer 架构之上,本节将围绕应用于机器翻译任务中的 Transformer 编码器与解码器结构进行介绍。

Transformer 最初是为了解决自然语言处理领域中的问题而提出的,在此之前,人们普遍采用 RNN 和 LSTM 等时序网络模型。然而,像 RNN 这类网络存在一些局限性,首先其记忆能力具有一定的长度限制,尤其对于 RNN 而言,记忆长度较短。因此后续提出了 LSTM 来解决这一问题。但这些模型仍然面临另一个挑战,即无法实现并行计算。这意味着必须依次完成 t_0

全部评论 (0)

还没有任何评论哟~