Advertisement

用网页抓取器从网易网页上抓取全部文字内容

阅读量:
复制代码
 #coding=utf-8

    
 #---------------------------------------
    
 #   程序:网易爬虫
    
 #   作者:ewang
    
 #   日期:2016-7-6
    
 #   语言:Python 2.7
    
 #   功能:获取网易页面中的文本信息并保存到TXT文件中。
    
 #---------------------------------------
    
  
    
 import string
    
 import urllib2
    
 import re
    
 import os
    
  
    
 class WangYi_Spider:
    
 	#申明相关属性
    
 	def  __init__(self):
    
 	    #给wangyiUrl属性赋值
    
 		self.wangyiUrl="http://www.163.com/"
    
 		#用来保存页面中文字信息
    
 		self.pageinfor=[]
    
 		print u'已经启动网易爬虫,爬爬...'
    
 	
    
 	#初始化加载页面并将其转码存储
    
 	def	wangyi(self):

全部评论 (0)

还没有任何评论哟~