Advertisement

数据分析Python实践(二)

阅读量:

三、 实验内容和实验步骤:
3.1 第一项内容:爬取大学排名
从最好大学网中获取549所国内高校的排名信息,包括学校名称、所在省市、总分及社会声誉等数据,并将这些内容进行输出。
3.2 第二项内容:爬取中国工程院院士信息
访问中国工程院官方网站,提取每位院士的个人简介并将其保存为本地文本文件,同时下载院士的照片并存储为图片文件。所有生成的文件均以院士姓名作为主文件名进行命名。
4.1 任务一实验步骤:
(1)通过Google Chrome或其他浏览器打开指定网址,随后在页面上右键点击,从弹出的菜单中选择“查看网页源代码”选项。
http://www.zuihaodaxue.cn/zuihaodaxuepaiming20链接19.html
(2)对获取到的网页源代码进行分析,识别出用于标识学校名称及其链接的HTML标签,为后续的数据解析工作做好准备。
(3)编写相应的程序代码,实现所需信息的抓取与处理。

复制代码
    import re
    from fake_useragent import UserAgent
    import requests
    
    
    def find_str(start, end, str):
    partten = r'(?<=%s).*?(?=%s)'%(start,end)

全部评论 (0)

还没有任何评论哟~