Advertisement

用于Python爬虫从OJ平台获取做题信息

阅读量:

网络爬虫的核心功能在于,通过访问特定的HTML网页,从获取的页面内容中借助正则表达式提取所需信息。Python语言提供了多个模块以支持此类操作,开发者可以通过查阅源代码了解其具体使用方式。

借助Python中的urllib和urllib2模块实现网络爬虫相对较为便捷,具体步骤如下:

a、设计符合需求的正则表达式;

b、使用urllib2模块中的urlopen函数访问目标网页,并将读取到的内容存储为字符串;

c、运用re模块中的findall函数查找与正则表达式匹配的信息,并将结果保存至列表中;

d、对列表中的数据进行进一步处理。

  1. 获取HTML网页内容的过程如下:

page = urllib.urlopen(url)

html = page.read()

  1. 通过Python内置的正则表达式功能提取所需信息:

re.findall(imgre, html)

其中,imgre代表所定义的正则表达式,而html变量则是第一步中获取到的网页源代码。上述操作的结果将返回一个包含提取内容的列表。

复制代码
 import webbrowser

    
 import re
    
 import urllib
    
  
    
 #获取hdu网页
    
 def getHtml_hdu(url):
    
     page = url

全部评论 (0)

还没有任何评论哟~