Advertisement

Spark RDD

阅读量:

Spark RDD编程模型解析

所涉及的技术体系包括:Spark框架、Hadoop分布式集群以及Scala编程语言。

实验内容概述

当前大约拥有500万条由搜索引擎生成的记录,其数据格式具体如下:

在这里插入图片描述

每条记录由6个数据项组成:第一个数据项表示信息生成的时间;第二个数据项表示用户标识,即UID;第三个数据项表示用户输入的搜索关键词;第四个数据项表示返回结果中URL链接的位置排序;第五个数据项表示用户点击链接的顺序编号;第六个数据项表示用户实际点击的URL链接地址。

请开发一个基于Scala语言的程序,完成以下功能:

(1)计算用户的总数,输出格式应为:

在这里插入图片描述

(2)筛选出搜索次数达到20次或以上的用户UID及其对应的搜索次数,并按照搜索次数由高到低进行排序,若搜索次数相同,则按UID由小到大排列,输出格式如下:

![在这里插入图片描述](

全部评论 (0)

还没有任何评论哟~