Advertisement

NLP关键信息抽取

阅读量:

keywordExtract.py

复制代码
    # -*- coding: utf-8 -*-
    
    import math
    
    import jieba
    import jieba.posseg as psg
    from gensim import corpora, models
    from jieba import analyse
    import functools
    
    
    # 停用词表加载方法
    def get_stopword_list():
    # 停用词表存储路径,每一行为一个词,按行读取进行加载
    # 进行编码转换确保匹配准确率
    stop_word_path = './stopword.txt'
    stopword_list = [sw.replace('\n', '') for sw in open(stop_word_path,encoding='utf-8').readlines()]
    return stopword_list
    
    
    # 分词方法,调用结巴接口
    def seg_to_list(sentence, pos=False):
    if not pos:
        # 不进行词性标注的分词方

全部评论 (0)

还没有任何评论哟~