Advertisement

Spark OLAP for Data with Nested Structures

阅读量:

文章结构概览

  • 引言
    • 将初始数据转化为DataFrame结构

      • 确定数据的组织形式
      • 从文件中加载数据为RDD格式
      • 对RDD[Protobuf]进行结构化处理,生成DataFrame
      • 对字段进行筛选与优化处理
    • 对嵌套结构的数据进行扁平化处理

      • 常规处理方式
      • 实现自动展开功能
    • 自动分析并解析SQL语句

      • 确定所使用的列信息

        • 提取select和aggregate相关的列信息
        • 确定filter条件涉及的列信息
        • 进行相关测试
      • 确认数据来源信息

      • 确定数据的时间属性

    • 小结

引言

【在多数系统中,所获取的初始日志数据通常呈现出半结构化或非结构化的特征。对于从事数据分析工作的人员而言,每次编写代码来处理这些原始数据既不够高效,也存在一定的操作难度。相比之下,二维表形式的数据更为直观且易于使用。因此,在数据处理的初始阶段,通常会将原始数据展开为一张底层的大宽表,以便供上层的数据应用或开发人员进行后续操作。然而,原始日志数据中往往包含大量字段,并且多为嵌套结构。这使得在构建底层大宽表时需要包含哪些字段以及如何处理嵌套结构成为一项具有挑战性的问题。

**是否可以直接运用SQL方法对原始数据

全部评论 (0)

还没有任何评论哟~