Advertisement

爬虫HelloWorld:抓取某博主所有文章

阅读量:

初步设定一个简单目标:首先获取所有文章的标题信息,其余属性可留待后续处理

  • 代码
复制代码
    import requests
    from bs4 import BeautifulSoup
    
    link = "http://www.cnblogs.com/planche/default.html"
    headers = {
    'user-agent': 'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/52.0.2743.82 Safari/537.36',
    'Host': 'www.cnblogs.com'
    }
    
    if __name__ == '__main__':
    pos=1
    while(True):
        key_dict = {'page': str(pos)}
        r = requests.get(link, headers=headers,params=key_dict,timeout=1)
        soup = BeautifulSoup(r.text, "html.parser")      #使用BeautifulSou

全部评论 (0)

还没有任何评论哟~