Spark中的ML与MLlib核心功能与技术架构差异,在数据预处理与特征工程方面存在显著差异,并分别提供了不同的机器学习算法实现
发布时间
阅读量:
阅读量
大数据学习过程中的一个核心环节就是Spark,在这个环节中涉及大量知识点。
由于Spark的复杂性,在其中的知识点往往容易让人混淆。
其中最容易让人混淆的就是ML与MLlib的区别,
我们不妨深入探究二者的区别。
1. Spark ML
1)定义:ark机器学习。
2)主要操作的对象:DataFrame。
DataFrames被视为DataSets的一种形式,并非简单的集合体;或者说是DataSets中的行数据块。DataSet通过封装RDD实现了对SQL等操作的支持,并为这些复杂查询提供了高效的执行能力。
2. Spark MlLib
1)定义:MLlib作为Spark的机器学习库提供。其目标旨在使实用的机器学习具备良好的可扩展性和易于使用性。在高层次上它提供了以下工具:
- 主要采用的学习方法:机器学习算法中包括多种具体方案如分类器、回归模型、聚类算法以及协同过滤技术
- 特征工程:通过特征提取将原始数据转化为适合建模的数值表示
- 特征工程中的变换:运用数学转换将数据分布变得更加符合建模需求
- 维数降解与变量选择:对高维度数据进行降维处理并结合筛选策略剔除冗余变量
- 工具构建:开发用于机器学习管道搭建的自动化工具包
- 工具评估机制与优化流程:建立系统化的评估标准并设计迭代优
全部评论 (0)
还没有任何评论哟~
