机器学习系列手记(二):特征工程之文本表示模型及Word2Vec
发布时间
阅读量:
阅读量
特征工程
特征工程之文本表示模型、Word2Vec
五、文本表示模型
1、词袋模型和N-gram模型
词袋模型的基本思路是将整段文本以词语为单位进行拆分,不考虑词语出现的顺序,进而将每篇文章转化为一个长向量。该向量中每一维对应一个特定的单词,而该维度所对应的权重则用于体现该词在原文本中的重要程度。通常采用TF-IDF方法对权重进行计算,其公式如下:
TF-IDF(t,d)=TF(t,d)×IDF(t)
其中,TF(t,d)表示单词t在文本d中出现的频率;而IDF(t)则是逆文本频率,用于评估单词t对于语义表达的重要性,其计算方式为:
IDF(T)=log \frac{文本总数}{包含单词t的文本总数+1}
如果某个词汇频繁地出现在大量文本中,则说明它可能是较为通用的词语,在区分某篇文档特殊语义方面的作用有限,因此需要对其权重进行适当调整。
仅对文章进行逐字划分可能会导致某些特定表达的意义被误解。因此,在实际操作中常会将连续n个词(n≤N)组成的短语(即N-gram)作为一个独立特征纳入向量表示之中,从而形成N-gram模型。此外,在实际应用过程中,同一词汇可能具有多种词性变化形式但含义相近,因此通常会对这些词汇实施词干提取处理,即将不同形式的词汇统一转换为相同的词干形式。
全部评论 (0)
还没有任何评论哟~
