Advertisement

python爬虫学习-scrapy获取拉勾职位信息及xpath方法

阅读量:

拉勾网作为爬虫学习过程中常被访问的平台,其反爬虫机制设计得相当完善。

获取拉勾网中与数据运营相关的职位信息,存在两种途径:

第一种方式是输入关键词“数据运营”进行搜索,此时页面的数据是通过json格式进行传输的。

第二种方式则是直接在首页点击“数据运营”这一标签,此时页面内容是由代码直接渲染生成的,因此可以运用xpath方法进行数据抓取,本文所采用的正是此种方法。

通过对页面结构的分析,需要采集的信息主要包括以下几个方面:职位名称、工作地点、企业名称、薪资区间、所需工作经验及学历要求、公司简介等。

以下为代码文件内容:

items.py

复制代码
 import scrapy

    
  
    
 class LagouscrapyItem(scrapy.Item):
    
     # define the fields for your item here like:
    
     name = scrapy.Field()#职位名称
    
     price = scrapy.Field()#工资区间
    
     company = sc

全部评论 (0)

还没有任何评论哟~