scrapy 爬虫实战
发布时间
阅读量:
阅读量
前言
先前课程项目中所采用的bs4与request库进行数据抓取的方式,如今看来略显稚嫩,随后转而开始运用更为专业的scrapy框架进行开发。
最小示例的构建与分析
- scrapy的安装
$ pip install scrapy
相较于使用pip安装可能引发无关错误的情况,在PyCharm中引入依赖库会更为可靠。
- 随后进行爬虫项目的建立
$ scrapy startproject kaggle
接下来需着手构建属于自己的网络爬虫程序
$ cd kaggle
$ scrapy genspider spider_name domain
此时便创建了一个名称为spider_name的爬虫,并且该爬虫的爬取范围被限制在特定的domain内。
在kaggle/spiders/spider_name.py文件中,可以查看到如下代码
import scrapy
class KspiderSpider(scrapy.Spider):
name = 'kspider'
全部评论 (0)
还没有任何评论哟~
