Advertisement

开发环境中的 sparkmllib 设置存在一些难点

阅读量:

SparkMLlib作为Spark平台中用于机器学习开发的组件,具备在大规模分布式数据集群中执行机器学习任务的能力,目前是支持分布式计算较为完善的机器学习框架之一。此外,还有其他支持分布式架构的机器学习工具,例如TensorFlow与DeepLearning4j。然而,SparkMLlib与Hadoop系统具有天然的兼容性优势,但其局限性在于不支持深度学习功能,而TensorFlow和DeepLearning4j则具备深度学习的支持能力。

好了,不再赘述,直接进入操作流程。

建议将SparkMLlib的开发环境部署于Ubuntu或CentOS系统之上,避免使用Windows平台。

切记不要选择Windows!!!不要选择Windows!!!若执意尝试,后果自负,届时勿怪未作提醒。

  1. 搭建CentOS或Ubuntu开发环境,可使用真实服务器或虚拟机进行安装

  2. 安装JDK,并推荐使用JDK8版本且确保其与IDEA版本相匹配

  3. 从IDEA官网下载适用于Linux系统的tar包,并通过百度搜索相关教程完成在CentOS或Ubuntu上的安装步骤

  4. 下载Scala并配置相应的环境变量(如遇遗忘问题可通过搜索引擎查询)

接下来是关键的注意事项:

  1. 在创建pom文件后,请确认已正确安装JDK和Scala

第一步:点击File菜单项,

全部评论 (0)

还没有任何评论哟~