Advertisement

Spark MLlib 分布式机器学习与并行训练的原理 Spark MLlib 分布式机器学习与并行训练的原理

阅读量:

从笔者的角度出发,在分布式机器学习训练领域中存在三种主要方案:具体来说,则是Spark MLlib、Parameter Server以及TensorFlow。当然,并非仅此三个平台;它们各自代表了三种主流的方法来解决分布式训练问题。可以说,在众多算法工程师的心目中, spark被广泛认为是流行的数据处理框架;然而随着Flink等后起之秀的竞争出现, spark的地位虽然受到了挑战,但依然保持着强大的影响力。为了实现数据处理与模型训练的一致性, 许多公司选择采用spark原生的机器学习平台MLlib来进行模型构建工作;这使得spark MLlib成为进入机器学习分布式领域的第一站选择之一。
选择spark MLlib不仅仅因为其流行的特性;更重要的是它所带来的并行计算方式所体现的核心理念——即通过将任务分解成多个独立的小任务来同时执行这些小任务,从而显著提升整体效率。
这种并行计算的方式无疑是一种直接且直观的方式;它体现了在大规模数据环境下最朴素也是最有效的解决方案。

Spark 的分布式计算原理

为了介绍 Spark MLlib 的分布式机器学习训练方法而在此之前回顾 Spark 的分布式计算原理这一核心内容

Spark是一种基于分布式计算的技术平台。所谓分布式计算是指计算节点之间不共享内存,并通过网络通信交换数据。需要注意的是,在 Spark 的最为常见应用

全部评论 (0)

还没有任何评论哟~