Advertisement

链家租房数据抓取与分析

阅读量:

一、抓取前准备工作:

复制代码
    1、创建一个爬虫项目:在指定的文件夹中 scrapy startproject xxx(项目名)
    2、在项目的spiders的目录中创建爬虫:scrapy genspider bd.py baidu.com
    3、在setting中修改robot协议为False,表示不遵守robot协议
    4、启动爬虫:scrapy crawl bd --nolog 不打印日志启动,在爬虫正常情况下使用
            scrapy crawl bd         打印日志启动,在爬虫没有正常返回情况下使用
            命令scrapy crawl是固定的,bd表示定义的爬虫名称
    5、爬虫启动后,自动去获取start_urls,下载相应的页面,返回给parse函数(固定)
复制代码
    1、scrapy genspider boss zhipin.com 是创建爬虫spider文件的命令
    其中scrapy genspider是固定的,boss是爬虫的名称,zhipin.com表示此爬虫可以爬取的域名
    
    2、修改start_urls,然后在parse函数中打印response
    
    3、在setting中添加 HTTPERROR_AL

全部评论 (0)

还没有任何评论哟~