Advertisement

Spark中的ML与MLlib核心功能与技术架构差异,在数据预处理与特征工程方面存在显著差异,并分别提供了不同的机器学习算法实现

阅读量:

大数据学习过程中的一个核心环节就是Spark,在这个环节中涉及大量知识点。

由于Spark的复杂性,在其中的知识点往往容易让人混淆。

其中最容易让人混淆的就是ML与MLlib的区别,

我们不妨深入探究二者的区别。

1. Spark ML

1)定义:ark机器学习。

2)主要操作的对象:DataFrame。

DataFrames被视为DataSets的一种形式,并非简单的集合体;或者说是DataSets中的行数据块。DataSet通过封装RDD实现了对SQL等操作的支持,并为这些复杂查询提供了高效的执行能力。

2. Spark MlLib

1)定义:MLlib作为Spark的机器学习库提供。其目标旨在使实用的机器学习具备良好的可扩展性和易于使用性。在高层次上它提供了以下工具:

  • 主要采用的学习方法:机器学习算法中包括多种具体方案如分类器、回归模型、聚类算法以及协同过滤技术
    • 特征工程:通过特征提取将原始数据转化为适合建模的数值表示
    • 特征工程中的变换:运用数学转换将数据分布变得更加符合建模需求
    • 维数降解与变量选择:对高维度数据进行降维处理并结合筛选策略剔除冗余变量
    • 工具构建:开发用于机器学习管道搭建的自动化工具包
    • 工具评估机制与优化流程:建立系统化的评估标准并设计迭代优

全部评论 (0)

还没有任何评论哟~