Advertisement

Python爬虫爬取百度百科词条

阅读量:

【参考了慕课网提供的网络爬虫教学内容,尝试编写了一个用于抓取百度百科信息的简易示例。

(1)安装Beautifulsoup4

BeautifulSoup作为Python语言中的一款网页解析工具,具备操作简便的特点。http://cuiqingcai.com/1319.html这个链接是介绍如何使用。这个库是需要安装的,进入Pthon安装目录下面的Scripts目录,执行pip install beautifulsoup进行安装。

(2)爬虫具体实现

整个爬虫系统由五个功能模块构成,依次为调度控制模块、网络页面获取模块、页面内容解析模块、网址资源管理模块以及数据输出模块。

URL管理模块承担着存储最新网页地址的任务,每当需要获取新的URL时,系统会提取最新的地址执行爬取操作。

复制代码
 #coding=utf8

    
 class UrlManager

全部评论 (0)

还没有任何评论哟~