链家租房数据抓取与分析
发布时间
阅读量:
阅读量
一、抓取前准备工作:
1、创建一个爬虫项目:在指定的文件夹中 scrapy startproject xxx(项目名)
2、在项目的spiders的目录中创建爬虫:scrapy genspider bd.py baidu.com
3、在setting中修改robot协议为False,表示不遵守robot协议
4、启动爬虫:scrapy crawl bd --nolog 不打印日志启动,在爬虫正常情况下使用
scrapy crawl bd 打印日志启动,在爬虫没有正常返回情况下使用
命令scrapy crawl是固定的,bd表示定义的爬虫名称
5、爬虫启动后,自动去获取start_urls,下载相应的页面,返回给parse函数(固定)
1、scrapy genspider boss zhipin.com 是创建爬虫spider文件的命令
其中scrapy genspider是固定的,boss是爬虫的名称,zhipin.com表示此爬虫可以爬取的域名
2、修改start_urls,然后在parse函数中打印response
3、在setting中添加 HTTPERROR_AL
全部评论 (0)
还没有任何评论哟~
