Advertisement

异步请求数据处理方法——爬虫总结1(XHR/JS)

阅读量:

【在获取到http://icloudy.cechina.cn/网页的时候,发现点击“加载更多”会出现新的内容,但是网页却没有发生变化,于是打开F12查看Network发现,会每次点击都会多出来一行,如下:

随机选择其中一个链接即可查看我们实际访问的网址信息:

通过观察xhr返回的header信息,可以明确地获取到异步请求所指向的url地址。此时若直接访问该地址(或在preview部分查看返回内容),即可发现所返回的数据正是所需的新闻数据,即目标爬取内容。随后需要对url的格式进行分析,通常这类url会遵循一定的规律。具体的实现代码如下:

复制代码
 from pyspider.libs.base_handler import *

    
  
    
  
    
 class Handler(BaseHandler):
    
     crawl_config = {

全部评论 (0)

还没有任何评论哟~