python 爬虫2
发布时间
阅读量:
阅读量
承接上一篇内容,本文将对BeautifulSoup爬虫的具体实施步骤进行说明。
注:主要目标仍为收集与人物相关的图片数据集。
本次操作依旧以https://www.jiepai.net/网站图片爬取为例。
1、首先需要对目标网站开展初步分析,结合实际需求来看,由于本项目聚焦于获取人脸相关资料,因此选择网站中涉及明星着装的页面作为重点抓取对象(https://www.jiepai.net/dapei/mingxingchuanyi)。因为BeautifulSoup主要是对html文件格式进行的解析,所以还是需要借助 requests __ 库用于提取对应网页的HTML内容。在开始编写代码之前,需先完成以下两个库的安装工作
pip install beautifulsoup4
pip install lxml

2、对该网页(https://www.jiepai.net/dapei/mingxingchuanyi),可以发现该网页是分页展示的,并且每一页都包含很多对象的素材,因此第一要务就是要获取所有的对
全部评论 (0)
还没有任何评论哟~
