中文文本分类:THUCNews数据集
发布时间
阅读量:
阅读量
中文文本分类问题:THUCNews数据集
- THUCNews数据集及其预处理流程
-
数据获取环节
- 样本规模:该集合包含多样化的新闻文本样本。
- 文本预处理步骤
- 文件读取操作:通过系统参数配置完成原始文本文件的加载。
- 构建词典的过程:采用统计语言模型框架生成初始词汇表。
- 调用词典加载函数:从外部存储中调用已训练好的词典进行后续操作。
-
2 特征向量化
-
- 2.1 TF-IDF
-
3 情感分析
-
4 模型搭建
-
- 4.1 CNN模型
- 4.2 RNN模型
-
5 参考
-
1 THUCNews数据集与预处理
1.1 数据集下载
本文基于清华NLP组所提供的THUCNews新闻文本分类数据集的一个子集
数据下载链接:
THUCNews数据子集:https://pan.baidu.com/s/1hugrfRu 密码:qfud
1.2 数据量
该数据集使用了其中的10个分类,每个分类6500条,总共65000条新闻数据。
类别如下:

还没有任何评论哟~
