Advertisement

n-grams表示连续出现的n个词组成的短语序列

阅读量:

用于计算一组词语出现概率的模型被定义为语言模型(Language Models),而在众多模型中,n-gram 是最为基础的一种形式。所谓n-gram,指的是由N个连续词语构成的序列:

  • N=2时,这种结构被称为2-gram(bigram)
  • N=3时,则被称作3-gram(trigram)

一个简单的例子

【在自然语言处理任务中,需要计算P(w\vert h),即已知历史信息h时预测词语w的概率。假设当前的历史信息h=its\ water\ is\ so\ transparent\ that,目标是确定下一个可能出现的词the的概率,表达式为:

P(the\ \vert\ its\ water\ is\ so\ transparent\ that)

一种实现方法是:通过构建一个大规模的语料库,统计特定历史序列h=its\ water\ is\ so\ transparent\ that的出现频率,并进一步统计该序列后接目标词the的完整序列h+the=its\ water\ is\ so\ transparent\ that the的出现次数。最终将后者频次除以前者频次,即:

$P(the\ \vert its \ water \ is \ so

全部评论 (0)

还没有任何评论哟~