Advertisement

中文文本分类:THUCNews数据集

阅读量:

中文文本分类问题:THUCNews数据集

  • THUCNews数据集及其预处理流程
    • 数据获取环节

      • 样本规模:该集合包含多样化的新闻文本样本。
      • 文本预处理步骤
        • 文件读取操作:通过系统参数配置完成原始文本文件的加载。
        • 构建词典的过程:采用统计语言模型框架生成初始词汇表。
        • 调用词典加载函数:从外部存储中调用已训练好的词典进行后续操作。
    • 2 特征向量化

      • 2.1 TF-IDF
    • 3 情感分析

    • 4 模型搭建

      • 4.1 CNN模型
      • 4.2 RNN模型
    • 5 参考

1 THUCNews数据集与预处理

1.1 数据集下载

本文基于清华NLP组所提供的THUCNews新闻文本分类数据集的一个子集
数据下载链接:
THUCNews数据子集:https://pan.baidu.com/s/1hugrfRu 密码:qfud

1.2 数据量

该数据集使用了其中的10个分类,每个分类6500条,总共65000条新闻数据。
类别如下:

![在这里插入图片描述](https://ad.itadn.com/c/weblog/blog-img/images

全部评论 (0)

还没有任何评论哟~