python爬虫实现博客数据爬取
发布时间
阅读量:
阅读量
本次数据获取过程中,采用requests库发起网页请求并获取返回的json格式数据,因此需借助json模块对text字段进行解析;随后运用pyquery工具对页面内容进行提取与处理;最终所获得的数据将被存储至mongodb数据库中。
import requests
from urllib.parse import urlencode
from pyquery import PyQuery as pq
from pymongo import MongoClient
base_url = 'https://m.weibo.cn/api/container/getIndex?'
headers = {
'Host': 'm.weibo.cn',
'Referer': 'https://m.weibo.cn/u/2830678474',
'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_12_3) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36',
全部评论 (0)
还没有任何评论哟~
