Spark RDD
发布时间
阅读量:
阅读量
Spark RDD编程模型解析
所涉及的技术体系包括:Spark框架、Hadoop分布式集群以及Scala编程语言。
实验内容概述
当前大约拥有500万条由搜索引擎生成的记录,其数据格式具体如下:

每条记录由6个数据项组成:第一个数据项表示信息生成的时间;第二个数据项表示用户标识,即UID;第三个数据项表示用户输入的搜索关键词;第四个数据项表示返回结果中URL链接的位置排序;第五个数据项表示用户点击链接的顺序编号;第六个数据项表示用户实际点击的URL链接地址。
请开发一个基于Scala语言的程序,完成以下功能:
(1)计算用户的总数,输出格式应为:

(2)筛选出搜索次数达到20次或以上的用户UID及其对应的搜索次数,并按照搜索次数由高到低进行排序,若搜索次数相同,则按UID由小到大排列,输出格式如下:

还没有任何评论哟~
