Advertisement

World never has much in terms of Embedding, only One Hot.

阅读量:

为何BERT模型中所采用的三个Embedding能够相加,这一问题具有相当的研究价值。苏剑林老师对此进行了深入解析:

从数学层面来看,Embedding的本质可以被理解为以one-hot向量作为输入的单层全连接网络。
换句话说,所谓的Embedding并非独立存在,其本质来源于one-hot编码。

接下来将从三个不同视角进行分析。

首先 ,Embedding可视为一种以one-hot向量为输入的单层全连接结构。

在这一结构中,Embedding矩阵实际上对应于全连接层中的参数。

当one-hot向量中1的位置与参数相连时,该位置对应的参数即为相应的Embedding向量。

其次 ,回到最初的问题:为什么BERT模型中的三个Embedding可以进行相加?

这种相加操作本质上等同于对三个one-hot特征进行拼接处理。

假设在BERT模型中,token Embedding矩阵的维度为[4,768];position Embedding矩阵的维度为[3,768];segment Embedding矩阵的维度为[2,768]。

对于一个特定字来说,其token one-hot表示为[1,0,0,0];position one-hot表示为[1,0,0];segment one-hot表示为[1,0]。

通过将这三个Embe

全部评论 (0)

还没有任何评论哟~