Advertisement

BeautifulSoup 语法笔记(用于爬取新浪新闻)

阅读量:

以新浪新闻的爬取过程作为实例

复制代码
 import re

    
 import requests
    
 from bs4 import  BeautifulSoup
    
 import json
    
 from datetime import datetime
    
  
    
 def getSoup(newsurl):
    
     res=requests.get(newsurl)
    
     res.encoding='utf-8'
    
     soup=BeautifulSoup(res.text,'html.parser')
    
     return soup
    
    
    
    

通过输出soup的结构信息,可以查看newsurl所指向的新浪新闻sh首页相关新闻链接的具体内容。

复制代码
     title=soup.select('title')[0].text
    

![](https://ad.itadn.com/c/weblog/blog-img/images

全部评论 (0)

还没有任何评论哟~