深入探讨Self-Attention知识点及代码实现
发布时间
阅读量:
阅读量
在当代自然语言处理领域,Transformer与BERT模型已广泛应用于各类任务之中,其中Self-Attention机制作为其核心组件,具有举足轻重的地位。接下来将通过问答形式并结合源代码,对Self-Attention的具体实现进行深入剖析。
Q&A
1、 Self-Attention 的核心是什么?
Self-Attention 的关键在于借助文本中其他词汇对目标词汇的语义表达进行强化,从而更充分地挖掘上下文信息。
2、Self-Attention 的时间复杂度是怎么计算的?
Self-Attention 的时间复杂度为 O(n^2 \cdot d),其中 n 表示序列长度,d 表示 embedding 维度,并不考虑 batch 维度。
Self-Attention 主要包括以下三个阶段:相似度计算、softmax 函数的应用以及加权平均操作。
[外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传(img-t9SG6ZU8-1603506048428)(./picture/self_attention.png)]
各步骤的时间复杂度分别为:
相似度计算 可以视为两个矩阵相乘,其中矩阵大小分别为 (n,d) 与 (d,n),其运算量为 O(n^2 \cdot d),最终得到一个 $(n,
全部评论 (0)
还没有任何评论哟~
