知识图谱学习笔记(B站课程)-p8-p13 视频内容与数据爬取导引
发布时间
阅读量:
阅读量
B站地址:https://www.bilibili.com/video/av70702610
侵权请联系删除
这一块的难点在于数据的异步加载,以汽车之家的官网为例:

通过查看源代码可知,在汽车品牌下车型数量方面存在一定的限制性表现。例如阿斯顿·马丁旗下车型数量82款是无法获取到的这一现象主要源于这部分数据通常是通过异步加载的方式获取的;因此传统的基于requests+beautifulsoup框架的传统静态解析方法已经无法满足当前需求。为此可采取以下两种解决方案:第一种方法则是模拟浏览器的方法已经无法满足需求;第二种方法则是通过对HTTP请求路径进行分析从而实现异步数据加载的目的
相较于第二种方案而言,在操作简便性上模拟浏览器表现更为突出。具体而言,则可以选择使用request_html或者selenium这两种技术路径。两者均为可选方案,在本次实验中我们采用了selenium技术路线。该系统支持通过Xpath和CSS样式来定位所需网页元素。
一、数据分析
首先
全部评论 (0)
还没有任何评论哟~
