预训练词表示为word2vec(1)
发布时间
阅读量:
阅读量
本系列内容将围绕自然语言处理任务中涉及的词表示(word representation)方法展开讲解。
所谓词表示,即通过连续、稠密且维度较低的向量形式来表达词语的特征,这与传统自然语言处理任务中常用的one-hot编码、ngram模型以及tf-idf等特征形式存在显著差异。词表示采用连续浮点数构成的向量形式,具备稠密性和低维度性,而传统特征则呈现出高度稀疏的特点,难以有效捕捉词语之间的关联性(如语义相似性、句法结构等),这对模型的学习过程造成不利影响;经过良好训练的词向量可作为神经网络的输入数据,神经网络通过分析词语间的依赖关系提取句子层面的特征信息,最终实现文本分类、序列转换等各类机器学习任务。此外,词向量表示也常被称为词嵌入(word embedding),其本质是将词语映射至向量空间中,并借助数学手段对自然语言中的词汇进行表征。
首先将对word2vec的基本原理进行介绍,随后还会依次讲解GloVe、ELMo、GTP和BERT等相关内容。
word2vec
word2vec是由Google于2013年Efficient Estimation of Word Representations in Vector Space发布并开源的一种模型。在word2vec出现之前,Bengio等
全部评论 (0)
还没有任何评论哟~
