Spark读取PMML文件并进行预测
发布时间
阅读量:
阅读量
软件版本管理
CDH版本为5.8.0,其中CDH-hadoop的版本为2.6.0,而CDH-spark的版本则为1.6.0
目标:
基于Spark平台加载PMML文件至模型中,并借助该平台完成预测任务(本次测试采用的是Spark on YARN的运行模式)。
具体实施目标如下:
1. 参考https://github.com/jpmml/jpmml-spark 提供的实现方式,确保能够执行基础示例;
2. 直接从HDFS读取输入数据文件,并利用PMML生成的模型进行预测操作;
(第一项与第二项之间的差异主要体现在输入数据的构建方式上,具体可参考下方提供的代码内容)
具体步骤概述
1. 获取初始数据集,初始数据集涵盖PMML文件及对应的测试数据,具体如下:
<?xml version="1.0" encoding="UTF-8" standalone="yes"?>
<PMML version="4.2" xmlns="http://www.dmg.org/PMML-4_2">
<Header description="linear SVM">
<Application name="Apache Spark MLlib"/>
<Timestamp>
全部评论 (0)
还没有任何评论哟~
