Advertisement

[Embeding-3] 词嵌入及其与分布式语义模型的关系

阅读量:

前言概述与研究背景

近年来,在众多自然语言处理任务中,无监督学习所生成的词向量已获得了显著的进展。其表现之优异,使得在诸多NLP系统架构中,传统分布式表示方法如LSA特征与Brown聚类几乎被完全替代。

不妨关注2017年举办的EMNLP与ACL会议,二者均对词嵌入技术给予了高度关注。即便是近期的ACL Communication,也明确指出词嵌入是推动NLP领域取得突破的关键因素。此时我们不禁需要深入思考,词嵌入技术是否真的有必要被如此广泛地推崇?

本篇综述的目标在于深入探讨词嵌入及其实际效果。我们将分析其发展历程,介绍当前主流的词嵌入模型,并探讨与之相关的各类挑战,同时尝试解答或澄清一些普遍存在的疑问与误解。随后,我们会通过将其与分布语义学领域的研究成果进行关联,并着重强调那些真正能够解释词嵌入模型取得成功的核心要素,从而揭示词嵌入所存在的表象问题。

2. 词嵌入简史

自20世纪90年代起,向量空间模型便被广泛应用于分布语义学领域。从那时开始,人们逐步见证了用于估计词语连续表示的数字模型的发展,其中潜在狄利克雷分配(LDA)与潜在语义分析(LSA)便是两个具有代表性的技术手段。

“词嵌入”这一术语最早由Bengio等人提出。在2003年,他通过神经语言模型以及对模型参数的训练方法,为词嵌入奠定了基础。然而,Collobert与Weston则是在

全部评论 (0)

还没有任何评论哟~