Advertisement

热词抽取与话题发现主题:郝晓玲的研究

阅读量:

1. 背景

社区数据的分析主要包含两大类:内容关联分析和社交网络分析。其中一项重要应用是用于识别热门话题的技术属于社区数据挖掘的重要组成部分;它能够从海量的UGC内容中提取出用户的兴趣焦点。这项应用涉及两大核心技术:自然语言处理技术和主题识别技术。

中文分词算法可分为两种:一类是基于语言规则的算法,即计算机可通过自然语言的语法规则、词汇属性等内在特征解析文本正确含义并实现分词功能;另一类是基于统计的学习方法,它通过计算词语在文本中的各种统计特征值来识别成词串。前者准确率较高且对已知语料库有较强的依赖性;后者则更加灵活适应性强,其具体应用可参考如信息熵、最大连续概率、互信息t检验等统计指标以及高频词语提取等相关技术参数。在UGC平台中,核心任务仍聚焦于热点词语挖掘与话题形成过程的研究与实践。

传统的做法通常是这样的:首先将文本进行分词处理,随后通过分析未能成功匹配的部分来识别潜在的新词汇

顾森(1)提出了基于内部凝固程度与自由运用程度的新词识别方法。贺敏(2)通过分析上下文邻接类型、首尾单字位置成词概率以及双字耦合度等多种语言特征,并分别筛选出候选新词。钟将(3)引入了互信息与信息熵这两个信息论工具用于衡量词语间的关联性,并构建了一个综合评估体系来整合这两项指标。

话题发现旨在从海量UGC内容中识别用户广泛讨论的话题。 其中一种常用的方法是基于文本聚类的技术。 结合

全部评论 (0)

还没有任何评论哟~