Advertisement

使用Python-Scapy工具从mooc网站获取数据并存储于数据库中同时提取图片

阅读量:

爬取的步骤

复制代码
    - 确定url地址;
    - 获取页面信息;(urllib, requests);
    - 解析页面提取需要的数据; (正则表达式, bs4, xpath)
    - 保存到本地(csv, json, pymysql, redis);
    - 清洗数据(删除不必要的内容 -----正则表达式);
    - 分析数据(词云wordcloud + jieba)
    
    

是否采用多线程技术?
爬虫程序在抓取网页数据时通常都会涉及这一操作,若重复编写代码将导致冗余。
配置请求头信息——包括用户代理、代理服务器等参数……

流程分析:

复制代码
    - 确定url地址:http://www.imooc.com/course/list;(spider)
    - 获取页面信息;(urllib, requests); ---(scrapy中我们不要处理)---(Downloader)
    - 解析页面提取需要的数据; (正则表达式, bs4, xpath)---: (spider)
    课程链接, 课程的图片url, 课程的名称, 学习人数, 课程描述
    - 保存到本地(csv, json, pymysql, redis); ----(pipeline)
    
    

全部评论 (0)

还没有任何评论哟~