Advertisement

基本了解ELMO模型

阅读量:

ELMO 本身是个根据当前上下文对 Word Embedding 动态调整的思路

ELMo采用了典型的双阶段学习机制,在第一个阶段通过大规模的语言模型实现预训练;第二个阶段则是在执行下游任务时从预训练网络中提取对应位置单词各层的词向量作为新特征补充到任务模型中。
上图展示了其预训练流程图,该网络架构采用了双向多层LSTM结构,目前的语言模型微调目标是在给定单词W及其前后文的前提下,准确预测该中心词W.其中,前向路径中的前缀上下文被输入到左端的正向双层LSTM编码器中,而右端逆向双层LSTM编码器则接收来自右往左排列的真实下文序列.
整个网络架构实际上是一种通用的设计方案.通过大量数据进行语言模型微调任务后,该架构能够预先学习完成一个成熟的双向多层LSTM结构.
值得注意的是,当输入一个新的未知句子Snew时,句子中的每一个词都能够获得三个层次的嵌入表示:最低层次是基于Word嵌入的基本表示;往上一层是由相应位置的第一个多向 LSTM单元生成的扩展嵌入;再往上一层则是经过第二个多向LSTM单元处理后的高级嵌入.
由此可见,ELMo不仅在学习单词嵌入的同时还构建了一个复杂的双向多层

全部评论 (0)

还没有任何评论哟~