电费敏感的数据挖掘二:文本特征构造
发布时间
阅读量:
阅读量
目录:
-
- 四. 文本特征处理
-
- 4.1 使用结巴进行分词操作
- 4.2 对手机号、户号等后接数字信息进行处理
- 4.3 引入文本特征信息
-
五. 文本特征的筛选过程
-
- 5.1 创建数据集合
- 5.2 构建稀疏矩阵表示
- 5.3 建立tf-idf特征向量
- 5.4 运用特征选择方法实现维度缩减
-
存储文本特征数据
-
- 四. 文本特征处理
四. 处理文本特征
4.结巴分词应用与分析
import jieba
print('开始处理表1中的文本特征...')
mywords = ['户号', '分时', '抄表', '抄表示数', '工单', '单号', '工单号', '空气开关', '脉冲灯', '计量表', '来电', '报修']
for word in mywords:
jieba.add_word(word)
stops = set()
with open(r'..\电费敏感预测\stopwords.txt', encoding = 'utf-8') as f:
for word in f
全部评论 (0)
还没有任何评论哟~
