Advertisement

Hadoop编程技巧(5):自定义输入格式类

阅读量:

Hadoop代码测试环境:Hadoop2.4

应用实例:当数据遵循一定的过滤规则并经过简单的预处理时可以采用自定义输入文件格式类

Hadoop内置的输入文件格式类有:

FileInputFormat<K,V>是基本的父类,在我们的自定义实现中可以直接继承并用作基础父类。当我们在自定义时,则可以直接将其用作我们的父类基础。

TextInputFormat(LongWritable, Text)被称为默认的数据处理格式。我们常说,在编程中,默认情况下无需特殊指明时就会采用该格式;其中key表示当前行与文件开始之间的距离,则value则存储当前行的原始字符串内容。

3)SequenceFileInputFormat<K,V>被称为序列文件输入格式,在Hadoop生态系统中被广泛采用。其用于处理数据时能够显著提升性能。然而,在实时监控或快速数据浏览方面存在不足。因此,在数据处理阶段推荐优先采用该格式,并在最终呈现时可借助可视化工具进行展示。

4)KeyValueTextInputFormat<Text,Text>是一种用于解析按Tab(即\th)分隔的数据的方法;当每行数据采用\th作为分隔符时,则可直接应用该格式导入,并将位于\th前的部分视为键值对中的键值区分割部分。

5)CombineFileInputFormat<K,V>合并大量小数据是使用;

6)Multiple

全部评论 (0)

还没有任何评论哟~