Advertisement

Pyspark中DataFrame与pandas中DataFrame之间的转换方式

阅读量:

Pyspark.sql.DataFrame与pandas.DataFrame之间的相互转换:

复制代码
 # pandas转spark

    
 values = pandas_df.values.tolist()
    
 columns = pandas_df.columns.tolist()
    
 spark_df = spark.createDataFrame(values, columns)
    
  
    
 # spark转pandas
    
 pandas_df = spark_df.toPandas()
    
    
    
    

spark和pandas的dataframe区别:

pandas spark
工作方式 单机,无法处理大量数据 分布式,能处理大量数据
存储方式 单机缓存 可以调用 persist/cache 分布式缓存
是否可变
index索引 自动创建 无索引
行结构 Pandas.Series Pyspark.sql.Row
列结构 Pandas.Series Pyspark.sql.Column
允许列重名

下面叙述一个详细的例子:

复制代码
 # -*- coding: utf-8 -*

全部评论 (0)

还没有任何评论哟~