Hadoop的序列化对象操作及其MapReduce编程实例
发布时间
阅读量:
阅读量
目录
- 1、基础定义
- 2、常见数据序列化形式
- 3、自定义 bean 对象实现序列化接口(Writable)
- 4、应用序列化Bean对象进行流量信息统计
-
- 4.1 设计用于流量统计的FlowBean类
- 4.2 开发FlowMapper组件
- 4.3 构建FlowReducer逻辑
- 4.4 实现FlowDriver驱动程序
1、基本概念
- 序列化(Serialization)指的是将具有特定结构的对象转换为字节流形式的过程。
- 反序列化(Deserialization)则是序列化的逆操作,即将字节流重新还原为对应的结构化对象。
- 在需要于不同进程之间传递对象或实现对象的持久化存储时,通常需要将对象序列化为字节流;相反地,当需要将接收到的字节流或者从磁盘读取的数据转换回对象时,则需执行反序列化操作。
- Java 中的序列化(Serializable)是一种较为复杂的序列化框架。当一个对象被序列化后,会包含大量额外信息,例如各种校验数据、头部信息以及继承关系等,这使得其在网络中进行传输时效率较低;因此,Hadoop 自主设计了一种更为精简高效的序列化机制(Writable) ,该机制相较于 Java 对象类无需传输复杂的继承体系结构,仅根据实际需求传输所需属性
全部评论 (0)
还没有任何评论哟~
