Advertisement

23行代码教你爬取图片

阅读量:

对于初学者而言,爬取妹子图这类任务在爬虫技术中并不具备较高的难度,适合作为练习项目进行尝试。

今日所爬取的目标网站为:http://www.youzi4.cc/mm/meinv/index_1.html

提示:在进行图片抓取时,通常需要设置请求来源标识(referer),否则即便链接无误,也可能频繁遭遇<response 404>的错误响应。

首先,需要对目标网页进行结构分析。

通过观察可以得知,网页的整体架构相对较为简洁,其中src属性所指向的链接即为图片的实际地址,因此我们尝试寻找获取该链接的方法。

2,代码如下

复制代码
 from bs4 import BeautifulSoup

    
 import requests
    
 import re
    
 num=1
    
 content='http://www.youzi4.cc/mm/meinv/index_'  
    
 headers = {'User-Agent':'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_12_0) AppleWebKit/5

全部评论 (0)

还没有任何评论哟~