Advertisement

数据挖掘中的爬虫用于抓取和解析网页信息

阅读量:

抓取的是豆瓣的API信息,并保存
豆瓣的API已经打不开了

复制代码
    import json
    import urllib.request as urlrequest
    id_list=[26387939,11803087,20451290]
    with open('movie.txt',"w") as file:
    for i in id_list:
        url_visit='https://api.douban.com/v2/movie/{}'.format(i)
        crawl_content=urlrequest.urlopen(url_visit).read()
        json_content=json.loads(crawl_content.decode('utf-8'))   #API是json文件
        rank=json_content['rating']['average']
        file.write("{}{}".format(i,rank))

获取的是来自豆瓣网页的信息
导入urllib模块后会获取豆瓣电影,并将id_list设置为豆瓣电影ID号

复制代码
    import urllib.request as urlrequest
    id_l

全部评论 (0)

还没有任何评论哟~