Advertisement

详述文本分类任务

阅读量:

概述

文本分类是自然语言处理的核心应用领域之一

传统机器学习方法

分类问题通常遵循以下步骤:首先进行特征提取;接着构建模型;然后进行算法优化;最后采用交叉验证方法来评估。对于文本数据而言,在进行特征提取方面既是一项重要工作也是充满挑战的。那么什么是文本的特征?又该如何将其量化表示为数学表达式?

最初的文本分类方法主要依据规则基础,并以关键词作为核心特征。例如,在体育类别中出现频率较高的关键词如足球等会被特别关注。为了便于后续计算处理,在文献整理阶段采用了词典构建策略,并结合one-hot编码方案将每个文本转化为1×V的二进制向量(其中V代表词典中单词总数),该向量中的元素值取值范围限定在0或1之间:0表示对应的词语未被包含在当前文本中;1则表示该词语确实存在于当前处理的对象之中。然而这种简单的二进制编码方式未能有效反映词语在整个文献库中的出现频率信息含量问题。因此逐渐出现了bag-of-words模型这一改进方案:即同样采用1×V长度向量表征每个文本内容;但与前一种方法不同的是,在这种模型下向量内的元素不再局限于0或1两种取值状态;而是量化为具体数值:即某个词语在整个文献库中出现的具体次数统计结果数值化表征方式(此处统计次数)。需要注意的是高频率出现的某些通用词汇未必会对具体分类任务产生显著影响作用:例如像'报道'这样的常用词汇,在新闻文档类别中通常不具

全部评论 (0)

还没有任何评论哟~