使用Python-Scapy工具从mooc网站获取数据并存储于数据库中同时提取图片
发布时间
阅读量:
阅读量
爬取的步骤
- 确定url地址;
- 获取页面信息;(urllib, requests);
- 解析页面提取需要的数据; (正则表达式, bs4, xpath)
- 保存到本地(csv, json, pymysql, redis);
- 清洗数据(删除不必要的内容 -----正则表达式);
- 分析数据(词云wordcloud + jieba)
是否采用多线程技术?
爬虫程序在抓取网页数据时通常都会涉及这一操作,若重复编写代码将导致冗余。
配置请求头信息——包括用户代理、代理服务器等参数……
流程分析:
- 确定url地址:http://www.imooc.com/course/list;(spider)
- 获取页面信息;(urllib, requests); ---(scrapy中我们不要处理)---(Downloader)
- 解析页面提取需要的数据; (正则表达式, bs4, xpath)---: (spider)
课程链接, 课程的图片url, 课程的名称, 学习人数, 课程描述
- 保存到本地(csv, json, pymysql, redis); ----(pipeline)
全部评论 (0)
还没有任何评论哟~
