Advertisement

基于NLP的文本聚类研究与分析

阅读量:
复制代码
    import pandas as pd
    from collections import Counter
    
    from sklearn.feature_extraction.text import CountVectorizer, TfidfVectorizer
    from sklearn.cluster import KMeans
    import re
    import string
    import jieba
    
    
    # 分词
    def tokenize_text(text):
    tokens = jieba.cut(text)  # 分词
    tokens = [token.strip() for token in tokens]  # 去空格
    return tokens
    
    
    def remove_special_characters(text):
    tokens = tokenize_text(text)
    pattern = re.compile('[{}]'.format(re.escape(string.punctuation)))
    filtered_tokens = filter(None, [pattern.sub(''

全部评论 (0)

还没有任何评论哟~