机器学习领域:自然语言处理入门、相似性分析、基于KNN的情感分类
发布时间
阅读量:
阅读量
文章结构概览
- 文本相似度分析
-
-
1.将评论内容转化为机器可识别的表达形式
-
- 1).分词(即将句子拆解为独立词语)
- 2).构建词袋模型(bag-of-word:可将其理解为一个包含所有词汇的容器)
- 3).基于词袋模型建立语料库(corpus:将每个句子转换为词袋形式进行存储)
- 4).将评论内容转化为词向量(此步骤为可选操作)
-
2.采用机器能够理解的算法对每条评论与所有评论之间的相似性进行评估
-
- TF-IDF
- TF计算公式:
- IDF计算公式:
-
示例代码:
-
-
情感分析
-
文本相似度分析
文本相似度分析:从大量数据(如文章、评论)中筛选出具有相似性的信息内容
步骤:
- 将评论内容转化为机器可识别的语言形式
- 运用机器可理解的算法对每条评论与所有其他评论进行逐一比对,评估其相似性程度
- 从中提取出相似性较高的评论内容
1.把评论翻译成机器看的懂的语言
1).分词(把句子拆分成词语)
该地点靠近川沙公路,但公交指引存在偏差,若选择乘坐"蔡陆线"将带来诸多不便,建议采用其他交通路径。整体住宿条件较为简陋。

还没有任何评论哟~
