主题模型之LSA源代码
发布时间
阅读量:
阅读量
文章结构概览
- 环境
-
CountVectorizer与TfidfVectorizer
-
- CountVectorizer
- TfidfVectorizer
-
数据采集
-
SVD奇异值分解方法
-
截断式SVD技术
-
环境
scikit-learn 版本为 0.22.2
scipy 版本为 1.4.1
numpy 版本为 1.18.1
CountVectorizer和TfidfVectorizer
CountVectorizer
# 将文本中的词语转换为词频矩阵
from sklearn.feature_extraction.text import CountVectorizer
vectorizer = CountVectorizer(min_df=1)
corpus = [ 'This is the first document.',
'This is the second second document.',
全部评论 (0)
还没有任何评论哟~
