利用爬虫技术从百度图片中提取关键词相关的信息
发布时间
阅读量:
阅读量
该项目开发了一款依据关键词自动抓取百度图片的程序,其核心功能包括以下几个方面:
1、设定具体的搜索关键词;
2、确定起始抓取页面及总的抓取页数;
3、为成功获取的图片分配序号,并记录未能成功抓取图片的具体原因;
4、将每次执行的抓取操作详细记录在txt文件中,便于后续查阅与存档。
代码实现如下:
# -*- coding:utf-8 -*-
import requests
import json
import re
import os
import urllib
import lxml
import time
import datetime
from urllib import request,parse
from bs4 import BeautifulSoup
class Baidu_spider():
def __init__(self):
# 创建文件夹
folders = os.path.exists('C:\ Users\ Zhang\ Desktop\ pachong\ ')
if not
全部评论 (0)
还没有任何评论哟~
