Transformer interview summary
发布时间
阅读量:
阅读量
1. Transformer的位置信息和bert的位置信息有什么不一样?
在Transformer模型中,token的位置信息是通过正弦波函数进行计算的 ,这种方式类似于模拟信号的周期性变化特征。这种具有循环性质的函数能够在一定程度上提升模型对未知数据的适应能力。
而BERT模型则是直接训练一个用于保存位置信息的position embedding ,具体来说,每个位置都会被随机初始化为一个向量,并在模型训练过程中不断优化调整。最终,这个经过训练得到的position embedding会与word embedding进行结合,其中BERT选择的是直接拼接的方式。
2. Transformer里layer-normlization的作用
在使用梯度下降法进行网络优化的过程中,随着网络深度的增加,数据分布会发生持续性的变化 。为了维持数据特征分布的稳定状态,通常会在网络中引入Layer Normalization技术,这一操作有助于加快模型收敛的速度。
归一化方法有多种类型,但它们的核心目标都是将输入数据转换为均值为0、方差为1的标准形式 。通常情况下,在将数据输入激活函数之前执行归一化处理,**这是因为我们希望避免输入数据进入激活函数的饱和区域,从而防止出现梯度消失的问题,
全部评论 (0)
还没有任何评论哟~
