Advertisement

scrapy 爬虫实战

阅读量:

前言

先前课程项目中所采用的bs4与request库进行数据抓取的方式,如今看来略显稚嫩,随后转而开始运用更为专业的scrapy框架进行开发。

最小示例的构建与分析

  • scrapy的安装
复制代码
    $ pip install scrapy
    
    
      
    

相较于使用pip安装可能引发无关错误的情况,在PyCharm中引入依赖库会更为可靠。

  • 随后进行爬虫项目的建立
复制代码
    $ scrapy startproject kaggle
    
    
      
    

接下来需着手构建属于自己的网络爬虫程序

复制代码
    $ cd kaggle
    $ scrapy genspider spider_name domain
    
    
      
      
    

此时便创建了一个名称为spider_name的爬虫,并且该爬虫的爬取范围被限制在特定的domain内。

在kaggle/spiders/spider_name.py文件中,可以查看到如下代码

复制代码
    import scrapy
    
    
    class KspiderSpider(scrapy.Spider):
    name = 'kspider'

全部评论 (0)

还没有任何评论哟~