语言模型在NLP中的预训练与微调
发布时间
阅读量:
阅读量
1 引言
语言模型(Language Model),它被称为由一系列词汇组成的序列的概率分布系统。该系统的主要功能在于估计长度为m的文字序列出现的可能性大小。然而,在实际应用中发现当文字序列过长时计算复杂度变得极为高昂。因此研究者们发展出一种更为高效的方法即n元模型(N-Gram Model)。这种简化方法的核心在于仅需关注当前文字前面紧随的前N个文字即可完成条件概率计算工作。传统上基于频率统计的技术被广泛应用于各阶N-Gram建模过程中但随着参数设置逐渐增大面临着数据稀疏性的挑战
为了缓解n元模型估算概率时遇到的数据稀疏问题, 研究者们提出了一种神经网络语言模型. 其中代表性的工作是由Bengio等人于2003年提出的. 该语言模型采用了三层前馈神经网络作为其架构. 其中有趣的是第一层参数, 这些参数不仅具有低维紧致性, 并且能够携带丰富的语义信息, 从而奠定了现代词向量技术的基础. 实际上, 在利用上下文预测下一个词的能力上无需依赖人工标注的数据集, 并且能够在海量单语资源中提取丰富的语义信息.
当前神经网络在执行训练任务时主要依赖于(BP)算法。这一过程通常包括以下步骤:首先通过对网络模型参数实施随机初始化;接着利用(BP)方法配合SGD等优化算法来优化这些参数。预训练的核心思想是:与直接随机初始化不同的是,在这种情况下我们先通过一个特定任务获得一组固
全部评论 (0)
还没有任何评论哟~
