Advertisement

深度学习-Keras与TextCNN进行文本分类基于Thucnews数据集

阅读量:

Thucnews数据集应用

鉴于本地计算设备的硬件条件存在限制,因此仅选取了4万条数据用于模型的训练与评估过程。我已将thucnews数据集完整存储于本地Mongo数据库中,具体信息如下所示(请注意其中label与lable这两个字段名称存在拼写差异,敬请忽略)。

mongo数据集示例

项目目录结构设计

在这里插入图片描述

其中,classify.py为负责分类功能的核心文件;classify_text.txt为测试样本,由自行收集的数据构成;gpos-vocab为自主训练生成的词汇表;stopwords为停用词列表;text_util.py为实现文本处理功能的工具模块;thucnews.json为从Mongo数据库中读取数据并存储至本地的文件。

代码如下

classify.py

复制代码
    #!/usr/bin/python
    # -*- c

全部评论 (0)

还没有任何评论哟~