自然语言处理(第五核心内容)
发布时间
阅读量:
阅读量
- 简单共现词判定模型
- TF-IDF 向量表征
- TF-IDF Word2Vec 表示
- Linear Sentence Embedding 表示
简单共有词判断模型
具体而言,在文本集合A与B中(即text corpus A and text corpus B),它们之间的相似程度可以通过以下公式计算(as shown below):Similarity = \frac{Num(A\cap B)}{Num(A\cup B)}
TFIDF向量表示
上述基于词袋模型的方式仅依赖于词语信息而未考虑其出现频率特征,在文本表示过程中引入TFIDF方法使词语得以量化表示。该方法不仅综合考虑了Term Frequency(词频)以及词语在文档中的分布情况,并且能够有效区分高频出现在不同文档中的术语差异性特征。具体而言, 文本A和文本B分别可表示为:
其中N代表词汇总量(或词汇库规模)。定义a_i = TF(i) \times IDF(i), 其中TF(i)代表词语i在文本中的频次, 而其在全部文本中的频次则由IDF(i)表征。同样地可得b_i. 在获得A、B两类文本各自的TF-IDF向量表达式后, 通过采用相似度函数f(a,b)来评估这两份文本之间的关联程度. 此外, 我们可以选择使用一阶范数\lvert a-b \rvert, 或者余
全部评论 (0)
还没有任何评论哟~
