Advertisement

深度学习笔记——深入理解Word2vec与Doc2vec原理及其代码实现

阅读量:

长期致力于自然语言处理领域的研究与实践,在深度学习框架中探索着Word2vec与Doc2vec技术的应用与发展。刚接触这类方法时总是停留在表面操作层面,并不能深入理解其背后的实现原理尚不甚清楚。正如孔子所言:"温故而知新",《周易》有云:"学而不思则罔"。为了深入理解它们的工作机制并结合开源代码进行了具体实现分析,在阅读相关领域的研究文献并参考了网上各位前辈的学习笔记与开源项目的基础上,本文尝试系统梳理Word2vec与Doc2vec的基本原理,并结合实际代码进行分析探讨以期抛砖引玉

将Deep Learning应用到NLP领域的朋友一定都有所了解的是嵌入技术(Embedding)。这种技术实际上是将词汇、短语或句子/文档转化为高维向量表示。为了使计算机能够处理符号形式的语言(符号),首要任务就是要找到一种方法将这些符号形式转化为数学化的形式进行运算和处理。

在NLP领域中,最直观且常用的词表示方法之一是one-hot编码方法。该方法通过将每个单词映射到一个长度极大的向量来进行表达。其维数等于词汇库的数量,并且在这些向量中仅有少数几个位置被赋予非零值;具体而言,在这些位置中只有一个位置会被赋值为1(通常位于特定索引位置),其余位置则均为0;这样的设置能够有效地标识出具体的词语所处的位置或状态。

举个例子来说:“科比”可能表示为[0001000000.....],而“篮球”可以

全部评论 (0)

还没有任何评论哟~