从零开始学PySpark(第7章):PySpark-ML部分中的转换器学习
发布时间
阅读量:
阅读量
Binarizer参数与功能解析
依据设定的临界值,将连续性变量转化为相应的二进制形式
# 创建session
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName('learn_ml').master('local[1]').getOrCreate()
from pyspark.ml.feature import Binarizer
df = spark.createDataFrame([(0.5,),(1.0,),(1.5,)], ['values'])
binarizer = Binarizer(threshold=0.7, inputCol="values", outputCol="features")
binarizer.transform(df).show()
+------+--------+
|values|features|
+------+--------+
|0.5|0.0|
|---|---|
|1.5|1.0|
+------+--------+
# 通过setParams,更改配置
binarizer.setParam
全部评论 (0)
还没有任何评论哟~
