基于NLP的文本聚类研究与分析
发布时间
阅读量:
阅读量
import pandas as pd
from collections import Counter
from sklearn.feature_extraction.text import CountVectorizer, TfidfVectorizer
from sklearn.cluster import KMeans
import re
import string
import jieba
# 分词
def tokenize_text(text):
tokens = jieba.cut(text) # 分词
tokens = [token.strip() for token in tokens] # 去空格
return tokens
def remove_special_characters(text):
tokens = tokenize_text(text)
pattern = re.compile('[{}]'.format(re.escape(string.punctuation)))
filtered_tokens = filter(None, [pattern.sub(''
全部评论 (0)
还没有任何评论哟~
