Advertisement

scrapy爬虫并保存数据库

阅读量:

在前一篇文章中,对利用scrapy实现基础爬虫操作进行了简要介绍。

<>

本文则在此基础上,进一步说明如何借助scrapy框架完成爬虫开发,并将获取的数据存储至数据库中。

1、scrapy 框架 __

如下图所示,为scrapy框架的结构示意图:

å¨è¿éæå¥å¾çæè¿°

其中,系统中包含两类中间件:下载器中间件(Downloader Middleware)与爬虫中间件(Spider Middleware)。通过引入中间件机制,可以在爬虫发起请求前或接收响应后对数据实施个性化调整,从而构建出适用于多种场景的爬虫程序。

  1. downloader Middleware

下载器中间件作为Scrapy框架中处理request/response流程的关键组件,是一个轻量级且处于底层的钩子系统,用于对全局范围内的Scrapy requestresponse进行修改。

该中间件可实现代理IP的切换、Cookies的更新以及User-Agent的替换,并支持自动重试功能。

实际上,Scrapy框架本身已内置了用户代理中间件(`UserAgentMid

全部评论 (0)

还没有任何评论哟~