基于Python的异步代理爬虫及其代理池
发布时间
阅读量:
阅读量
本文主要讲述了基于Python实现异步代理爬虫及其相关知识介绍,并具有较高的参考价值作用,请各位读者耐心阅读以下内容
- 爬虫部分
核心代码
async def start(self):
for rule in self._rules:
parser = asyncio.ensure_future(self._parse_page(rule)) # 根据规则解析页面来获取代理
logger.debug('{0} crawler started'.format(rule.__rule_name__))
if not rule.use_phantomjs:
await page_download(ProxyCrawler._url_generator(rule), self._pages, self._stop_flag) # 爬取代理网站的页面
else:
await page_download_phantomjs(ProxyCrawler._url_generator(rule), self._pages,
rule.phantomjs_load_flag, self._stop_flag) # 使用PhantomJS爬取
await self._pages.j
全部评论 (0)
还没有任何评论哟~
