Advertisement

Spark读取PMML文件并进行预测

阅读量:

软件版本管理

CDH版本为5.8.0,其中CDH-hadoop的版本为2.6.0,而CDH-spark的版本则为1.6.0

目标:

基于Spark平台加载PMML文件至模型中,并借助该平台完成预测任务(本次测试采用的是Spark on YARN的运行模式)。

具体实施目标如下:

1. 参考https://github.com/jpmml/jpmml-spark 提供的实现方式,确保能够执行基础示例;

2. 直接从HDFS读取输入数据文件,并利用PMML生成的模型进行预测操作;

(第一项与第二项之间的差异主要体现在输入数据的构建方式上,具体可参考下方提供的代码内容)

具体步骤概述

1. 获取初始数据集,初始数据集涵盖PMML文件及对应的测试数据,具体如下:

复制代码
 <?xml version="1.0" encoding="UTF-8" standalone="yes"?>

    
 <PMML version="4.2" xmlns="http://www.dmg.org/PMML-4_2">
    
     <Header description="linear SVM">
    
     <Application name="Apache Spark MLlib"/>
    
     <Timestamp>

全部评论 (0)

还没有任何评论哟~