PySpark程序从hdfs获取数据计算其topn结果存入hdfs
发布时间
阅读量:
阅读量
问题:选出蜀国中五虎将
原始数据如下:
编号 姓名 战力值 所属国家
1 刘备 68 蜀国
2 马超 90 蜀国
3 黄忠 91 蜀国
4 魏延 76 蜀国
5 姜维 92 蜀国
6 关羽 96 蜀国
7 严颜 78 蜀国
8 孟达 64 蜀国
9 张飞 88 蜀国
10 马谡 76 蜇国
11 赵云 95 蜀国
12 法正 88 蜀国
预期输出结果如下:
6 关羽 96 蜇国
11 赵云 95 蜇国
5 姜维 92 蜇国
3 黄忠 91 蜇国
2 马超 90 蜇国
创建新的数据文件

步骤
在使用pyspark进行相关操作时,建议首先引入必要的库文件,其中包含findspark模块,此举有助于预防可能出现的难以理解的异常信息。

设置sparkcontext,采用l
全部评论 (0)
还没有任何评论哟~
