Advertisement

也谈python爬虫

阅读量:

当前关于Python网络爬虫的相关资料已较为丰富,鉴于项目 __ 的实际需要,需获取与人脸相关的数据集,因此决定借助爬虫技术来扩充部分数据内容。以下将结合尚街拍(https://www.jiepai.net/)网站的具体爬虫过程来对python)的requests库,对具体的爬虫实施过程进行归纳与总结。

1、首先需对目标网站进行初步分析,并结合实际需求展开。由于本项目的核心关注点在于收集人脸相关数据,因此将重点爬取网站中涉及明星着装的页面内容(https://www.jiepai.net/dapei/mingxingchuanyi))

2、对该网页(https://www.jiepai.net/dapei/mingxingchuanyi),可以发现该网页是分页展示的,并且每一页都包含很多对象的素材,因此第一要务就是要获取所有的对象连接)进行分析。在本人进行数据采集时,该页面已包含607个页面,且该网站仍在持续更新之中。。。。

![](https://ad.itadn.com/c/weblog/blog-img/images/2026-03-13/U0ybKmHsdCNtv

全部评论 (0)

还没有任何评论哟~