Advertisement

开发python5网络爬虫

阅读量:
复制代码
    # 爬虫的流程和常用包
    # import requests 发送请求
    # import re     正则表达式
    # import bs4   解析源代码
    
    # requests.get  -- 基于URL,发送网络请求
    # re.findall   -- 基于正则表达式,搜寻目标数据
    # bs4.BeautifulSoup  -- 对HTML源代码做解析,便于目标数据的拆解
复制代码
    #对红牛公司进行网络爬虫
    import requests
    import re
    import bs4
    
    url = r'http://www.redbull.com.cn/about/branch'
    requests = requests.get(url)
    requests  #返回值以2开头说明是正确的
    requests.text   #提取为字符串
    
    soup = bs4.BeautifulSoup(requests.text)  #转换为soup格式
    company = re.findall('<h2>(.*?)</h2>', requests.text)
    address = [i.text for i in s

全部评论 (0)

还没有任何评论哟~