用Python编写豆瓣数据爬虫
发布时间
阅读量:
阅读量
在Python 3.7的运行环境下,通过调用urllib模块完成了对豆瓣页面数据的抓取操作!
本次实施过程中所采用的工具包括urllib以及re这两个核心模块,具体实施步骤如下!
import urllib.request
import re
import ssl
url = "https://read.douban.com/provider/all"
def doubanread(url):
ssl._create_default_https_context = ssl._create_unverified_context
data = urllib.request.urlopen(url).read()
data = data.decode("utf-8")
pat = '<div class="name">(.*?)</div>'
mydata = re.compile(pat).findall(data)
return mydata
def writetxt(mydata):
fw = open("test.txt
全部评论 (0)
还没有任何评论哟~
