Advertisement

Python-爬虫程序

阅读量:

#简介
每当论文遭到拒稿并重新投稿时,都需要查阅与自身研究内容相关的最新会议信息。遇到此类情况,我通常会通过访问www.myhuiban.com这一网站,逐一浏览所有会议,并重点关注三个要素:投稿截止日期、CCF分类以及会议的具体内容。

##TODO: 需要添加网站截图,以更直观地阐述该需求的由来
经过一番思考,或许我可以编写一个简易的Python爬虫程序,将全部会议列表下载至本地,并构建一个完整的会议索引数据库。这样一来,便能够根据个人需求进行灵活的搜索操作。

从昨日下午至今日中午,我编写了大约400行的Python代码,基本实现了预期功能。在此过程中遇到的主要挑战包括模拟网站登录、正则表达式提取数据、JSON格式的编码与解码、文件读写操作以及命令行参数处理等。

#整体框架
Cookie模块: 主要用于模拟用户登录过程,并存储cookie信息以供后续使用
爬虫模块: 首先获取会议列表第一页的所有数据,并解析出下一页链接;随后依次抓取每页的会议信息,并针对每个会议的具体页面提取详细内容后存入内存字典及文件中
Json转换模块: 负责将存储在内存中的会议字典对象转化为字符串形式并保存至文件中;同时也能从文件中读取数据并生成对应的会议列表
搜索模块: 用于构建命令行参数体系,并对所有已存储的会议信息进行模式匹配查询

#具体模块
##Cookie模

全部评论 (0)

还没有任何评论哟~