Advertisement

LDA主题模型分词、词云和模型

阅读量:

这记录了我本科阶段的学习过程,从最初对Python一无所知,逐步成长为能够编写并运行出计算结果相关代码的阶段。所有代码均经过测试可正常运行,部分内容可参考我之前的文章,本章节主要用来整理和记录我的编程实践过程。

结巴分词

复制代码
    # -*- coding: utf-8 -*-
    import jieba
    import jieba.analyse
    import jieba.posseg as pseg
    import re
    
    # 加载词典
    jieba.load_userdict('dict.txt')
    
    # 创建停用词list
    def stopwordslist(filepath):
    stopwords = [line.strip() for line in open('stop_words.txt', 'r', encoding='utf-8').readlines()]
    return stopwords
    
    # 对句子进行分词
    def seg_sentence(sentence):
    sentence_seged = jieba.cut(sentence.strip())
    stopwords = stopwordslist('stop

全部评论 (0)

还没有任何评论哟~