Advertisement

统计语言模型-学习笔记

阅读量:

统计语言模型作为自然语言处理(Natural Language Processing,NLP)领域的基础性框架,其本质是从概率统计的视角出发,构建用于解析自然语言上下文关联特性的数学模型。该模型的关键在于评估某一特定句子在文本中出现的可能性大小。

模型

设S为一个具有实际意义的语句,其由一组按照特定顺序排列的词语\omega_{1}, \omega _{2}, \ldots, \omega_{n}构成,其中n代表该语句的长度。当前的目标是确定S在文本中出现的可能性,即求出S的概率P(S),可表示为P(S)=P(\omega_{1}, \omega _{2}, \ldots, \omega_{n})

依据条件概率的基本公式:

P(\omega_{1}, \omega _{2}, \ldots, \omega_{n})=P(\omega_{1})\cdot P(\omega_{1}|\omega_{2})\cdot P(\omega_{3}|\omega_{1},\omega_{2}) \ldots P(\omega_{n}|\omega_{1},\omega_{2} \ldots, \omega_{n-1})

通常情况下,P(\omega_{1}|)是一种更为严谨的表达方式,用于表示词语\omega_{1}在句子s开头出现的概率。由于语句

全部评论 (0)

还没有任何评论哟~