Advertisement

利用爬虫技术从百度图片中提取关键词相关的信息

阅读量:

该项目开发了一款依据关键词自动抓取百度图片的程序,其核心功能包括以下几个方面:

1、设定具体的搜索关键词;

2、确定起始抓取页面及总的抓取页数;

3、为成功获取的图片分配序号,并记录未能成功抓取图片的具体原因;

4、将每次执行的抓取操作详细记录在txt文件中,便于后续查阅与存档。

代码实现如下:

复制代码
 # -*- coding:utf-8 -*-

    
 import requests
    
 import json
    
 import re
    
 import os
    
 import urllib
    
 import lxml
    
 import time
    
 import datetime
    
 from urllib import request,parse
    
 from bs4 import BeautifulSoup
    
  
    
  
    
 class Baidu_spider():
    
     def __init__(self):
    
  
    
     # 创建文件夹
    
     folders = os.path.exists('C:\ Users\ Zhang\ Desktop\ pachong\ ')
    
     if not

全部评论 (0)

还没有任何评论哟~