Advertisement

Python xpath 技术栈 从 线上 教育 平台 抓取 数据 生成 词云

阅读量:

需求:

  • 爬取的链接: http://www.imooc.com/course/list

  • 爬取的内容: 课程的链接地址,课程所使用的图片资源地址,课程的具体名称,参与学习的人数,以及课程的相关描述信息;

  • 爬取的内容如何存储:

    • 文件格式(如.csv等);
    • mysql数据库;
  • 对爬取到的信息进行分析;

    • 制作词云图

1 获取页面内容

复制代码
    import re
    
    import requests
    import lxml.etree as etree
    import csv
    
    
    def get_content(url):
    """爬取页面内容的函数"""
    
    try:
        user_agent = "Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/59.0.3071.109 Safari/537.36"
        response = requests.get(url, headers={'User-Agent': user_agent})
        response.raise_for_st

全部评论 (0)

还没有任何评论哟~