学pyspark(十):利用pyspark.ml.clustering模块对商场顾客进行分类
发布时间
阅读量:
阅读量
数据下载:
基于Kaggle平台提供的商场客户数据分析资料
数据准备:
数据量较为有限,在本研究中采用四个关键指标:性别、年龄、收入水平以及消费倾向作为分析维度。其中重点考察收入水平与消费倾向这对变量对客户群体划分分析具有重要意义。
from pyspark.sql import SparkSession
spark = SparkSession.builder.master('local[1]').appName('learn_cluster').getOrCreate()
# 导入数据
df = spark.read.csv('file:///home/ffzs/python-projects/learn_spark/Mall_Customers.csv', header=True, inferSchema=True)
# 更换列名
df = df.withColumnRenamed('Annual Income (k$)', 'Income').withColumnRenamed('Spending Score (1-100)', 'Spend')
# 看下数据
df.show(3)
+----------+------+---+------+-----+
|Cu
全部评论 (0)
还没有任何评论哟~
