Advertisement

基于Python的异步代理爬虫及其代理池

阅读量:

本文主要讲述了基于Python实现异步代理爬虫及其相关知识介绍,并具有较高的参考价值作用,请各位读者耐心阅读以下内容

  1. 爬虫部分
    核心代码
复制代码
    async def start(self):
     for rule in self._rules:
     parser = asyncio.ensure_future(self._parse_page(rule)) # 根据规则解析页面来获取代理
     logger.debug('{0} crawler started'.format(rule.__rule_name__))
     if not rule.use_phantomjs:
      await page_download(ProxyCrawler._url_generator(rule), self._pages, self._stop_flag) # 爬取代理网站的页面
     else:
      await page_download_phantomjs(ProxyCrawler._url_generator(rule), self._pages,
    rule.phantomjs_load_flag, self._stop_flag) # 使用PhantomJS爬取
     await self._pages.j

全部评论 (0)

还没有任何评论哟~