Advertisement

电费敏感的数据挖掘二:文本特征构造

阅读量:

电费敏感数据挖掘一: 数据处理与特征工程

目录:

    • 四. 文本特征处理
        • 4.1 使用结巴进行分词操作
        • 4.2 对手机号、户号等后接数字信息进行处理
        • 4.3 引入文本特征信息
      • 五. 文本特征的筛选过程

        • 5.1 创建数据集合
        • 5.2 构建稀疏矩阵表示
        • 5.3 建立tf-idf特征向量
        • 5.4 运用特征选择方法实现维度缩减
      • 存储文本特征数据

四. 处理文本特征

4.结巴分词应用与分析

复制代码
    import jieba
    
    print('开始处理表1中的文本特征...')
    mywords = ['户号', '分时', '抄表', '抄表示数', '工单', '单号', '工单号', '空气开关', '脉冲灯', '计量表', '来电', '报修']
    for word in mywords:
    jieba.add_word(word)
    
    stops = set()
    with open(r'..\电费敏感预测\stopwords.txt', encoding = 'utf-8') as f:
    for word in f

全部评论 (0)

还没有任何评论哟~