用于Python爬虫从OJ平台获取做题信息
发布时间
阅读量:
阅读量
网络爬虫的核心功能在于,通过访问特定的HTML网页,从获取的页面内容中借助正则表达式提取所需信息。Python语言提供了多个模块以支持此类操作,开发者可以通过查阅源代码了解其具体使用方式。
借助Python中的urllib和urllib2模块实现网络爬虫相对较为便捷,具体步骤如下:
a、设计符合需求的正则表达式;
b、使用urllib2模块中的urlopen函数访问目标网页,并将读取到的内容存储为字符串;
c、运用re模块中的findall函数查找与正则表达式匹配的信息,并将结果保存至列表中;
d、对列表中的数据进行进一步处理。
- 获取HTML网页内容的过程如下:
page = urllib.urlopen(url)
html = page.read()
- 通过Python内置的正则表达式功能提取所需信息:
re.findall(imgre, html)
其中,imgre代表所定义的正则表达式,而html变量则是第一步中获取到的网页源代码。上述操作的结果将返回一个包含提取内容的列表。
import webbrowser
import re
import urllib
#获取hdu网页
def getHtml_hdu(url):
page = url
全部评论 (0)
还没有任何评论哟~
