Advertisement

python爬虫实现博客数据爬取

阅读量:

本次数据获取过程中,采用requests库发起网页请求并获取返回的json格式数据,因此需借助json模块对text字段进行解析;随后运用pyquery工具对页面内容进行提取与处理;最终所获得的数据将被存储至mongodb数据库中。

复制代码
 import requests

    
 from urllib.parse import urlencode
    
 from pyquery import PyQuery as pq
    
 from pymongo import MongoClient
    
  
    
 base_url = 'https://m.weibo.cn/api/container/getIndex?'
    
  
    
 headers = {
    
     'Host': 'm.weibo.cn',
    
     'Referer': 'https://m.weibo.cn/u/2830678474',
    
     'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_12_3) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36',
    

全部评论 (0)

还没有任何评论哟~