网络新闻评论系统实现观点挖掘
发布时间
阅读量:
阅读量
前言
网络新闻观点 mining 系统本质上属于 文本数据 mining 范畴;在早期阶段, 文本 mining 方式主要源自 Web 文本 mining 领域。然而, 该系统的规模调节具有可控性;粗粒度分析相较于 细粒度分析 更为便捷;粗粒度处理能够迅速揭示 普通网民 对某一新闻的观点趋势。
系统设计目标
过去对数据挖掘相关算法进行了深入研究。然而由于个人兴趣偏向于其他方向长期未有主动学习智能化数据分析工具的习惯。恰逢其会地有机会参与毕业设计项目,在其中承担观点挖掘与分析的任务。该系统旨在针对一条特定的新闻报道 能够基于一千条评论数据 对其观点倾向分类进行识别 并为其提供信息参考依据
系统设计模块
系统主要模块分为4大模块,下面是主要的模块组成:
字典库与数据源的获取
字典库采用了包含约2万条记录的现有TXT文件作为基础数据集。尽管相对简单易行,但该数据源的具体收集过程则涉及一些步骤。这些步骤主要依赖于之前介绍过的QQ爬虫工具(详情请参见:详情点击这里)。该工具通过访问新闻详情页获取其HTML代码,并利用正则表达式匹配找到cmt_id字段(即评论ID),随后发送另一个请求至指定URL以获取真实的评论内容。需要注意的是,在本次系统设计中,默认每次最多可抓取50条评论(即单篇新闻最多返回50条评论),累计抓取约1000条评论左右(即每天
全部评论 (0)
还没有任何评论哟~
