语言模型与RNN结合
发布时间
阅读量:
阅读量
语言模型
一串自然语言文本被视为一个离散时间序列;基于长度为 T 的词系列 w_1, w_2, \ldots, w_T(其中每个词代表特定时刻的一个词汇),语言模型旨在评估该系列词是否构成合理的句子,并确定其概率值。
P(w_1, w_2, \ldots, w_T).
语言模型
假设序列w_1, w_2, \ldots, w_T中的每个词是依次生成的,我们有

例如,一段含有4个词的文本序列的概率
P(w_1, w_2, w_3, w_4) = P(w_1) P(w_2 \mid w_1) P(w_3 \mid w_1, w_2) P(w_4 \mid w_1, w_2, w_3).
语言模型的参数主要涉及两个方面:一是词汇的概率分布;二是基于前缀条件下的条件概率。假设我们采用一个大规模的语言数据库作为训练素材,在这种情况下,“w₁”这一词汇的概率可以通过其在训练语料库中出现频率与总词汇量的比例来确定。例如,在这种情况下,“w₁”的概率可以计算为:

还没有任何评论哟~
