Advertisement

Hadoop的自定义化排序与分区功能

阅读量:

我们通常会在数据分析中采用某种排序方式,并且为了防止数据分布偏向问题而需要我们自定义分区策略。在本节中具体探讨如何对某城市连续四年内的温度数据进行排列组合研究。其中我们将该城市的年度平均气温按年份递增顺序进行排列 而在同一年度的气温数值则按照递减顺序进行处理以确保数据分析的一致性和准确性。

  • 自定义排序

    • 定义一个封装对象
    • 定义排序方法
  • 自定义分区

    • 自定义分区
    • 自定义分组
  • 主函数

  • 分区与分组

自定义排序

定义一个封装对象

该对象需要实现WritableComparable接口

复制代码
    public class MyClass implements WritableComparable<MyClass>{
    	private int year;
    	private int temperature;
    	public int getYear() {
    		return year;
    	}
    	public void setYear(int year) {
    		this.year = year;
    	}
    	public int getTemperature() {
    		return temp

全部评论 (0)

还没有任何评论哟~