World never has much in terms of Embedding, only One Hot.
发布时间
阅读量:
阅读量
为何BERT模型中所采用的三个Embedding能够相加,这一问题具有相当的研究价值。苏剑林老师对此进行了深入解析:
从数学层面来看,Embedding的本质可以被理解为以one-hot向量作为输入的单层全连接网络。
换句话说,所谓的Embedding并非独立存在,其本质来源于one-hot编码。
接下来将从三个不同视角进行分析。
首先 ,Embedding可视为一种以one-hot向量为输入的单层全连接结构。
在这一结构中,Embedding矩阵实际上对应于全连接层中的参数。
当one-hot向量中1的位置与参数相连时,该位置对应的参数即为相应的Embedding向量。
其次 ,回到最初的问题:为什么BERT模型中的三个Embedding可以进行相加?
这种相加操作本质上等同于对三个one-hot特征进行拼接处理。
假设在BERT模型中,token Embedding矩阵的维度为[4,768];position Embedding矩阵的维度为[3,768];segment Embedding矩阵的维度为[2,768]。
对于一个特定字来说,其token one-hot表示为[1,0,0,0];position one-hot表示为[1,0,0];segment one-hot表示为[1,0]。
通过将这三个Embe
全部评论 (0)
还没有任何评论哟~
