Advertisement

第16篇学习笔记:基于CNN的垃圾邮件类型分析

阅读量:

数据集清洗

(load_one_file()这里需要注意的是,在处理文件时系统默认采用UTF-8编码方案;然而,在某些情况下如果直接使用UTF-8或者GBK等特定字符集打开数据文件可能会导致问题;因此建议将encoding设置为CP502或者其他合适的字符集以解决兼容性问题)

复制代码
 def load_one_file(filename):

    
     x=""
    
     with open(filename,encoding="cp852") as f:
    
     for line in f:
    
         line = line.strip()
    
         line=line.strip('\n')
    
         line = line.strip('\r')
    
         x+=line
    
     return x
    
  
    
 def load_files_from_dir(rootdir):
    
     x=[]
    
     list = os.listdir(rootdir)
    
     for i in range(0, len(list)):
    
     path = os.path.join(rootdir, lis

全部评论 (0)

还没有任何评论哟~