Pyspark中DataFrame与pandas中DataFrame之间的转换方式
发布时间
阅读量:
阅读量
Pyspark.sql.DataFrame与pandas.DataFrame之间的相互转换:
# pandas转spark
values = pandas_df.values.tolist()
columns = pandas_df.columns.tolist()
spark_df = spark.createDataFrame(values, columns)
# spark转pandas
pandas_df = spark_df.toPandas()
spark和pandas的dataframe区别:
| 项 | pandas | spark |
|---|---|---|
| 工作方式 | 单机,无法处理大量数据 | 分布式,能处理大量数据 |
| 存储方式 | 单机缓存 | 可以调用 persist/cache 分布式缓存 |
| 是否可变 | 是 | 否 |
| index索引 | 自动创建 | 无索引 |
| 行结构 | Pandas.Series | Pyspark.sql.Row |
| 列结构 | Pandas.Series | Pyspark.sql.Column |
| 允许列重名 | 否 | 是 |
下面叙述一个详细的例子:
# -*- coding: utf-8 -*
全部评论 (0)
还没有任何评论哟~
