Advertisement

PySpark按行拆分DataFrame

阅读量:

近期在实际业务操作中遇到了这一特定情境,然而通过百度搜索并未寻得有效的应对措施。

最终,我在Stack Overflow平台上提出相关问题,并成功获取了可行的解决方案。

原问题链接为:https://stackoverflow.com/questions/58317153/how-to-split-the-pyspark-dataframe-based-on-the-content-of-the-line。如果有其他解决方法我也会及时更新。

以下将对具体需求进行详细说明。


原始数据示例如下:

复制代码
 +------------+

    
|value|

    
 +------------+
    
|Date20191009|

    
|1|

    
|2|

    
|3|

    
|Date20191010|

    
|1|

    
|4|

    
|5|

    
 +------------+
    
    
    
    

从展示的信息可以发现,初始数据以1列的PySpark DataFrame形式存在。该列数据包含两种类型:

  1. 文件名称(如“ DATE20191009”)
  2. 文件具体内容(如“ 1”,“ 2”,“ 3”)

所期望达成的最终成果如下:

全部评论 (0)

还没有任何评论哟~