D3页面分析(Xpath)
发布时间
阅读量:
阅读量
一、网络数据爬取与分析
爬虫技术对随机性、运气因素以及思维跳跃能力有着极高的要求。
在本次项目实施过程中,我们首先定位到京东图书的页面并进入其中。
京东平台所有图书的API接口地址为:
http:/book.jd.com/booksort.html
(建议自行前往京东官网进行查找确认)
对于每本图书而言,都会存在大类与小类的分类方式。
思考方向包括以下几个方面:
-
如何实现分类信息的抓取
-
翻页功能的实现方式 ---> nextwork(通过谷歌开发者工具进行检查)
-
循环遍历操作的终止条件
-
如何判定当前小分类下的图书数据已全部获取完成
-
在提取nextwork路由信息时,可以借助谷歌浏览器的抓包工具,点击next work按钮以定位相关数据
-
如果开发人员遵循规范化的编程标准,通常会使用page作为参数来处理分页逻辑
总而言之,谷歌浏览器在实际开发过程中确实非常实用。
翻页功能所依赖的主要参数是page,可以通过循环机制进行数据抓取
二、xpath基本使用
- 分享xpth的安装包
https://pan.baidu.com/s/14hqPKdvW4A6ib7RpYY8Ttw
提取码:
751q
安装的方式如下:
将压缩包解压后,定位到谷歌浏览器的扩展程序管理界面,将相关文件拖入即可完
全部评论 (0)
还没有任何评论哟~
