数据挖掘中的爬虫用于抓取和解析网页信息
发布时间
阅读量:
阅读量
抓取的是豆瓣的API信息,并保存
豆瓣的API已经打不开了
import json
import urllib.request as urlrequest
id_list=[26387939,11803087,20451290]
with open('movie.txt',"w") as file:
for i in id_list:
url_visit='https://api.douban.com/v2/movie/{}'.format(i)
crawl_content=urlrequest.urlopen(url_visit).read()
json_content=json.loads(crawl_content.decode('utf-8')) #API是json文件
rank=json_content['rating']['average']
file.write("{}{}".format(i,rank))
获取的是来自豆瓣网页的信息
导入urllib模块后会获取豆瓣电影,并将id_list设置为豆瓣电影ID号
import urllib.request as urlrequest
id_l
全部评论 (0)
还没有任何评论哟~
