Advertisement

用Python编写豆瓣数据爬虫

阅读量:

在Python 3.7的运行环境下,通过调用urllib模块完成了对豆瓣页面数据的抓取操作!

本次实施过程中所采用的工具包括urllib以及re这两个核心模块,具体实施步骤如下!

复制代码
 import urllib.request

    
 import re
    
 import ssl
    
  
    
 url = "https://read.douban.com/provider/all"
    
  
    
 def doubanread(url):
    
     ssl._create_default_https_context = ssl._create_unverified_context
    
     data = urllib.request.urlopen(url).read()
    
     data = data.decode("utf-8")
    
     pat = '<div class="name">(.*?)</div>'
    
     mydata = re.compile(pat).findall(data)
    
     return mydata
    
  
    
 def writetxt(mydata):
    
     fw = open("test.txt

全部评论 (0)

还没有任何评论哟~