Advertisement

获取腾讯新闻评论数据集

阅读量:

前言

基于当前正在进行的观点挖掘研究工作背景,在分析现有方法时发现其数据源主要集中在网络评论领域。考虑到新闻报道的影响力及其潜在价值,在选择具体研究对象时自然会优先考虑新闻报道的相关信息作为基础素材来源。而一篇热门新闻往往会在短时间内积累数以千计的评论反馈,在这种情况下如何分析这些评论内容并从中提取有价值的信息将是一个极具挑战性的课题。

为什么爬的是腾讯新闻的数据

我最近在浏览了大量的关于爬取新闻数据的技术帖后发现除了腾讯这一家之外还有新浪网易等多家也比较常见但它们网站上的请求地址并非那么容易被解析出来而腾讯新闻相对来说较为简单通过初步分析我发现可以通过运用技术手段构建相应的请求路径从而获取到这些平台上的评论信息例如我们可以参考下面这个具体的链接这个来源也是我在网络上搜集整理得到的信息

[文章] 转载自微信公众号: coral

链接附带的参数还是有点多的,下面给出参数的各个意思:

http://coral.qq.com/article/ 评论页ID标识符(如cmt_id)/comment?commentid=起始标识码&reqnum=呈现数量&tag=&callback=mainComment&_=时间戳后跟三位随机编码

最后一位随机值实际上并没有多大意义。接着点击链接后,在所截取的一条评论中(即选取其中一条评论数据)

复制代码

由一个规模极为庞

全部评论 (0)

还没有任何评论哟~