Advertisement

深入探讨Self-Attention知识点及代码实现

阅读量:

在当代自然语言处理领域,Transformer与BERT模型已广泛应用于各类任务之中,其中Self-Attention机制作为其核心组件,具有举足轻重的地位。接下来将通过问答形式并结合源代码,对Self-Attention的具体实现进行深入剖析。

Q&A

1、 Self-Attention 的核心是什么?

Self-Attention 的关键在于借助文本中其他词汇对目标词汇的语义表达进行强化,从而更充分地挖掘上下文信息。

2、Self-Attention 的时间复杂度是怎么计算的?

Self-Attention 的时间复杂度为 O(n^2 \cdot d),其中 n 表示序列长度,d 表示 embedding 维度,并不考虑 batch 维度。

Self-Attention 主要包括以下三个阶段:相似度计算、softmax 函数的应用以及加权平均操作。

[外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传(img-t9SG6ZU8-1603506048428)(./picture/self_attention.png)]

各步骤的时间复杂度分别为:

相似度计算 可以视为两个矩阵相乘,其中矩阵大小分别为 (n,d)(d,n),其运算量为 O(n^2 \cdot d),最终得到一个 $(n,

全部评论 (0)

还没有任何评论哟~