Python爬虫爬取百度百科词条
发布时间
阅读量:
阅读量
【参考了慕课网提供的网络爬虫教学内容,尝试编写了一个用于抓取百度百科信息的简易示例。
(1)安装Beautifulsoup4
BeautifulSoup作为Python语言中的一款网页解析工具,具备操作简便的特点。http://cuiqingcai.com/1319.html这个链接是介绍如何使用。这个库是需要安装的,进入Pthon安装目录下面的Scripts目录,执行pip install beautifulsoup进行安装。

(2)爬虫具体实现
整个爬虫系统由五个功能模块构成,依次为调度控制模块、网络页面获取模块、页面内容解析模块、网址资源管理模块以及数据输出模块。

URL管理模块承担着存储最新网页地址的任务,每当需要获取新的URL时,系统会提取最新的地址执行爬取操作。
#coding=utf8
class UrlManager
全部评论 (0)
还没有任何评论哟~
