Advertisement

从RDD中提取每个字段的值,并利用DataFrame.collect()方法实现数据筛选和存储

阅读量:

近期接触了一些与大数据开发相关的知识,项目中涉及了HDFS结合Spark与Hive的开发流程。由于本人仅是为了了解开发流程,因此作为初学者在面对某些问题时会产生一些独特的想法,导致处理效率相对较低,目前我仍在持续学习和优化相关技能。
我希望完成的任务是对HDFS中存储的文件进行筛选与处理。例如,我现在手头有一份学生成绩数据表,目标是将其中“成绩高于60分”的学生信息录入系统。数据文件的结构为(字段依次为stuId、stuName、stuGrade):

以下为实现该功能的代码示例:

复制代码
    import com.sun.org.apache.xalan.internal.xsltc.compiler.util.IntType
    import org.apache.spark.sql.functions.desc
    import org.apache.spark.sql.{Row, SaveMode, SparkSession}
    import org.apache.spark.sql.types.{DataType, IntegerType, StringTy

全部评论 (0)

还没有任何评论哟~