Advertisement

Efficient Estimation of Word Representations in Vector Space [E-1]的翻译版本

阅读量:

1. abstract

我们设计了两种新型的模型架构,并将其应用于大规模语言数据集中的单词连续向量提取问题上。通过在词相似性任务上的评估指标和前人使用不同神经网络架构的技术进行比较分析,在计算资源有限的情况下(即计算成本显著降低),我们观察到模型性能得到了显著提升——即在仅需不到一天的时间内实现了对包含16亿个词的大规模中文数据集的学习,并获得了高质量的词向量表示。进一步研究表明,在测试集上这些向量展示了超越现有方法的能力

2. introduction

许多现有的自然语言处理系统将单词视为不可分割的基本单位——这是因为词汇表中每个单词都以唯一的索引表示,在这种设计下单词之间不存在相似的概念。这一选择有诸多优势:它使得实现起来更加简便直观;此外,在大量数据环境下训练简单的模型往往能取得更好的效果 than 复杂系统的训练效果。例如,在统计语言模型中广泛使用的 n-gram 方法如今几乎可以在包含数十万亿个词(参见文献[3])的数据集中构建这些模型。

然而,在众多领域中简单的技术都是有限制性的例如在自动语音识别相关的领域的应用往往受限于其所需的数据量相对有限性能主要取决于拥有高质量转录语音数据的能力通常约达数百万人物而在机器翻译领域当前广泛使用的语言仅能支撑数十亿数量级的语言资源或者更少

近年来机器学习技术取得了显著进展,在更大规模的数据集中构建更为复杂的

全部评论 (0)

还没有任何评论哟~