搜索引擎类页面的小框架 / 通用的小爬虫(PHP和Python版本)
发布时间
阅读量:
阅读量
近期抽空对爬虫相关内容进行了整理,开发了一个简易的爬虫框架(工具),方便日后在需要使用爬虫时无需重复编写代码,同时也作为爬虫教程的示例进行记录。
该爬虫主要用于抓取搜索引擎的相关数据,能够适用于多数搜索引擎的搜索结果页面的数据获取。
整个爬虫的开发流程及此类爬虫的设计思路如下:
1. 首先明确目标网页;
2. 输入不同的关键词,并选择相应的排序方式以及每页显示结果的数量(如果存在这些选项)等;
3. 每次调整选项并点击“搜索”按钮后,观察地址栏中 url 参数的变化,以此确定需要抓取网页的具体 url;
4. 基于上述 url 编写代码尝试获取网页源码;
5. 成功获取源码后,开始对其进行分析,并编写用于提取所需数据的正则表达式;
6. 利用已编写的正则表达式对源码进行匹配处理,从而提取出目标数据内容;
7. 根据实际需求对所提取的数据进行进一步处理。
以下以百度学术为例,编写一个用于每日检索本人研究方向最新论文的爬虫程序,以便在出现新论文时能够及时提醒本人查阅。
这一过程较为简单,学习起来也较为迅速。
实现步骤概述
进入百度学术平台,输入本人的研究主题“protocol reverse”,随后点击“搜索”按钮,留意地址栏中显示的url信息。
接下来选择“按时间排序”选项,如图所示
全部评论 (0)
还没有任何评论哟~
