Advertisement

D3页面分析(Xpath)

阅读量:

一、网络数据爬取与分析

爬虫技术对随机性、运气因素以及思维跳跃能力有着极高的要求。

在本次项目实施过程中,我们首先定位到京东图书的页面并进入其中。

京东平台所有图书的API接口地址为:

http:/book.jd.com/booksort.html

(建议自行前往京东官网进行查找确认)

对于每本图书而言,都会存在大类与小类的分类方式。

思考方向包括以下几个方面:

  1. 如何实现分类信息的抓取

  2. 翻页功能的实现方式 ---> nextwork(通过谷歌开发者工具进行检查)

  3. 循环遍历操作的终止条件

  4. 如何判定当前小分类下的图书数据已全部获取完成

  5. 在提取nextwork路由信息时,可以借助谷歌浏览器的抓包工具,点击next work按钮以定位相关数据

  6. 如果开发人员遵循规范化的编程标准,通常会使用page作为参数来处理分页逻辑

总而言之,谷歌浏览器在实际开发过程中确实非常实用。

翻页功能所依赖的主要参数是page,可以通过循环机制进行数据抓取

二、xpath基本使用

  1. 分享xpth的安装包

https://pan.baidu.com/s/14hqPKdvW4A6ib7RpYY8Ttw

提取码:

751q

安装的方式如下:

将压缩包解压后,定位到谷歌浏览器的扩展程序管理界面,将相关文件拖入即可完

全部评论 (0)

还没有任何评论哟~