Word2vec原理与Python实现
发布时间
阅读量:
阅读量
目录
一、为什么需要Word Embedding
二、Word2vec原理
1、CBOW模型
2、Skip-gram模型
三、行业上已有的预训练词向量
四、用Python训练自己的Word2vec词向量
一、为什么需要Word Embedding
在自然语言处理领域中,默认最基础的单位是词,在此基础上词构建句子进而组织成段落、篇章以及文档。因此,在进行自然语言处理时首要任务就是对词进行深入处理。
让我们举一个简单的例子来说明如何评估词语的情感倾向。假设我们要确定某个词语属于正向或负向情感类别。我们可以采用机器学习的方法来建立函数关系f使得对于每一个具体的词语内容x f(x) = y的关系能够成立其中x代表具体的词语文本 y则是对应的情感标签。在自然语言处理中 词语被抽象化为符号形式 这些符号信息需要被转换为可计算的形式 具体来说 这涉及到将这些符号信息嵌入到高维的空间中 这种嵌入方式被称为词嵌入技术(Word Embedding)。而Word2vec算法正是这一类方法的经典代表之一 它通过将词语映射到一个低维的连续向量空间中 来捕捉语义相似性以及其他潜在特征
这表明,在将自然语言转化为计算机能够处理的形式方面,我们需要找到一种方法来将人类理解的语言转化为数学空间中的向量。这种向量不仅能够反映词汇本身的语义信息,并且在数学空间中这些相似
全部评论 (0)
还没有任何评论哟~
