TF-IDF(一种衡量关键词权重的算法)
发布时间
阅读量:
阅读量
TF(Term frequency)-词频,IDF(Inverse document frequency)-逆文本频率
TF-IDF是一种用于评估关键词重要性的计算方式。其主要应用领域包括:(1)信息检索(2)关键术语抽取(可应用于文本分类任务)
最初阶段,人们通过词频来判断关键词的重要性,即特定词语在语料库中出现的次数占比。
表示为 TF(w)=\frac{word}{corpus}
具体而言,即为关键词w在文本中出现的次数与整个语料库中所有单词总数的比值。
然而,这种方法存在一定的局限性。例如,“的”这类常见虚词虽然出现频率极高,但对最终的关键信息提取并无实质帮助,这类词汇通常被归类为停用词(stop word),需要在处理过程中予以剔除;此外,在新闻分类等场景下,“报道”等高频词汇虽频繁出现于各类文章中,但并不适合作为文章的核心关键词。
针对上述问题提出改进方案:若某一词语仅出现在少量文档中,则其重要性应相应提高,并可作为有效的分类或搜索关键词。这种基于文档分布特征进行权重计算的方式即为逆文本频率。
公式如下:

全部评论 (0)
还没有任何评论哟~
