数据挖掘笔记:Review_1
发布时间
阅读量:
阅读量
基于斯坦福CS246课程资料撰写的期末学习总结
**
**
**
与机器学习、人工智能及数据库统计相比,数据挖掘更侧重于以下方面:
1. 特征维度与样本规模的可拓展性
2. 算法设计与系统架构
3. 对海量数据进行自动化的处理能力
如何系统整合数据挖掘相关知识内容:
依据所处理的数据形式差异
结合所选用的计算模型类型
针对具体的应用场景需求
依托所使用的数学分析工具
LSH,局部敏感哈希
**

1. Shingling步骤,将文档转化为集合形式
a) K-Shingles是通过提取文档中长度为k的字符串集合来表示文档内容
b) 利用0和1来标识某一特定长度为k的字符串是否存在,从而进一步对Shingles进行压缩处理
c) 经过压缩后的文档Shingles表将作为后续MinHash处理过程中的输入矩阵
2. MinHash的作用机制
a) 通过应用随机序列PI进行置换操作,将基于Shingles表示的文档特征矩阵转换为维度更低的签名矩阵
b) 具体实现方式是:对于特
全部评论 (0)
还没有任何评论哟~
