正则表达式 - 去掉乱码字符、提取字符串中的中英文字母 - Python代码
发布时间
阅读量:
阅读量
目录
1.乱码符号类型相对有限,可采用replace()函数处理
2.乱码字符类型较为复杂,建议使用re.sub()函数进行替换
3.从字符串中筛选出中文字符
4.从字符串中提取中文字符与数字信息
5.其他相关处理方式
在数据清洗过程中,一个常见的困扰便是数据中常常夹杂着各类乱码符号,例如!@#¥%……&——+*(){}:“》《?|【
1.乱码符号种类较少,用replace()
当字符串中仅存在少量乱码符号时,可通过replace函数进行替换操作,鉴于我们仅需对字符串中的个别字符进行修改,因此直接采用str.replace("#","")的方式即可完成处理;
#只有一类乱码字符串
df['name'] = df['name'].str.replace("#","")
#连续多个字符一起替换
df['name'] = df['name'].str.replace("#","").str.replace("&","").str.replace("*","")
2.乱码字符种类较多,用re.sub()
import re
string = "北京大学beijing985大学@#¥
全部评论 (0)
还没有任何评论哟~
