PySpark按行拆分DataFrame
发布时间
阅读量:
阅读量
近期在实际业务操作中遇到了这一特定情境,然而通过百度搜索并未寻得有效的应对措施。
最终,我在Stack Overflow平台上提出相关问题,并成功获取了可行的解决方案。
原问题链接为:https://stackoverflow.com/questions/58317153/how-to-split-the-pyspark-dataframe-based-on-the-content-of-the-line。如果有其他解决方法我也会及时更新。
以下将对具体需求进行详细说明。
原始数据示例如下:
+------------+
|value|
+------------+
|Date20191009|
|1|
|2|
|3|
|Date20191010|
|1|
|4|
|5|
+------------+
从展示的信息可以发现,初始数据以1列的PySpark DataFrame形式存在。该列数据包含两种类型:
- 文件名称(如“ DATE20191009”)
- 文件具体内容(如“ 1”,“ 2”,“ 3”)
所期望达成的最终成果如下:
全部评论 (0)
还没有任何评论哟~
