Advertisement

python 爬虫2

阅读量:

承接上一篇内容,本文将对BeautifulSoup爬虫的具体实施步骤进行说明。

注:主要目标仍为收集与人物相关的图片数据集。

本次操作依旧以https://www.jiepai.net/网站图片爬取为例。

1、首先需要对目标网站开展初步分析,结合实际需求来看,由于本项目聚焦于获取人脸相关资料,因此选择网站中涉及明星着装的页面作为重点抓取对象(https://www.jiepai.net/dapei/mingxingchuanyi)。因为BeautifulSoup主要是对html文件格式进行的解析,所以还是需要借助 requests __ 库用于提取对应网页的HTML内容。在开始编写代码之前,需先完成以下两个库的安装工作

复制代码
 pip install beautifulsoup4

    
 pip install lxml
    
    
    
    

2、对该网页(https://www.jiepai.net/dapei/mingxingchuanyi),可以发现该网页是分页展示的,并且每一页都包含很多对象的素材,因此第一要务就是要获取所有的对

全部评论 (0)

还没有任何评论哟~