Advertisement

主题模型之LSA源代码

阅读量:

文章结构概览

  • 环境
    • CountVectorizer与TfidfVectorizer

      • CountVectorizer
      • TfidfVectorizer
    • 数据采集

    • SVD奇异值分解方法

    • 截断式SVD技术

参考: numpy“手撕”文本主题模型之LSA

环境

scikit-learn 版本为 0.22.2
scipy 版本为 1.4.1
numpy 版本为 1.18.1

CountVectorizer和TfidfVectorizer

CountVectorizer

复制代码
    # 将文本中的词语转换为词频矩阵
    from sklearn.feature_extraction.text import CountVectorizer
     
    vectorizer = CountVectorizer(min_df=1)
     
    corpus = [      'This is the first document.',
                'This is the second second document.',

全部评论 (0)

还没有任何评论哟~