Python xpath 技术栈 从 线上 教育 平台 抓取 数据 生成 词云
发布时间
阅读量:
阅读量
需求:
-
爬取的内容: 课程的链接地址,课程所使用的图片资源地址,课程的具体名称,参与学习的人数,以及课程的相关描述信息;
-
爬取的内容如何存储:
- 文件格式(如.csv等);
- mysql数据库;
-
对爬取到的信息进行分析;
- 制作词云图
1 获取页面内容
import re
import requests
import lxml.etree as etree
import csv
def get_content(url):
"""爬取页面内容的函数"""
try:
user_agent = "Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/59.0.3071.109 Safari/537.36"
response = requests.get(url, headers={'User-Agent': user_agent})
response.raise_for_st
全部评论 (0)
还没有任何评论哟~
