python爬虫学习-scrapy获取拉勾职位信息及xpath方法
发布时间
阅读量:
阅读量
拉勾网作为爬虫学习过程中常被访问的平台,其反爬虫机制设计得相当完善。
获取拉勾网中与数据运营相关的职位信息,存在两种途径:
第一种方式是输入关键词“数据运营”进行搜索,此时页面的数据是通过json格式进行传输的。
第二种方式则是直接在首页点击“数据运营”这一标签,此时页面内容是由代码直接渲染生成的,因此可以运用xpath方法进行数据抓取,本文所采用的正是此种方法。
通过对页面结构的分析,需要采集的信息主要包括以下几个方面:职位名称、工作地点、企业名称、薪资区间、所需工作经验及学历要求、公司简介等。

以下为代码文件内容:
import scrapy
class LagouscrapyItem(scrapy.Item):
# define the fields for your item here like:
name = scrapy.Field()#职位名称
price = scrapy.Field()#工资区间
company = sc
全部评论 (0)
还没有任何评论哟~
