TF-IDF学习与应用分析过程
发布时间
阅读量:
阅读量
对于想在自然语言处理领域有所建树的技术人员而言,TF-IDF是一种基础且必修的核心算法。作为一个非专业人士,在此之前我仅凭零散的知识点了解了该算法的大致原理。然而,在近期翻阅了吴军先生的《数学之美》一书后,在书中对TF-IDF这一技术的详细阐述让我对之有了更加深入的理解。
TF-IDF是一种用于评估文本重要性的统计指标。该指标通过衡量单个词汇在整个语料库中的重要性来计算其权重值。具体而言,在给定语料库中某份文件中单个词汇出现次数越多,则其重要性权重值越高;相反地,在整个语料库中共有词语分布越广,则其重要性权重值越低。
其中,①通过算法的TF 部分来进行评估;②通过IDF 来进行评估。
TF代表Term Frequency即关键词频率或单文本频率其计算方法是将文件中关键词出现次数与总词汇量之比值作为该关键词在文件中的频率值例如在一个包含一万单词的文章中'人工智能'一词出现了十七次'发展'一词出现了二十三次而'的'这个助词却出现了百一十三次因此其对应的TF值分别为零零一七零零二三和零一二三
IDF:Inverse Document Frequency,一般称为“逆文本频率指数”。计算方法:

还没有任何评论哟~
