Advertisement

从零开始学PySpark(第7章):PySpark-ML部分中的转换器学习

阅读量:

Binarizer参数与功能解析

依据设定的临界值,将连续性变量转化为相应的二进制形式

复制代码
    # 创建session
    from pyspark.sql import SparkSession 
    spark = SparkSession.builder.appName('learn_ml').master('local[1]').getOrCreate()
    
    from pyspark.ml.feature import Binarizer
    df = spark.createDataFrame([(0.5,),(1.0,),(1.5,)], ['values'])
    binarizer = Binarizer(threshold=0.7, inputCol="values", outputCol="features")
    binarizer.transform(df).show()
    
    +------+--------+
|values|features|

    +------+--------+
|0.5|0.0|
|---|---|
|1.5|1.0|

    +------+--------+
    # 通过setParams,更改配置
    binarizer.setParam

全部评论 (0)

还没有任何评论哟~