Hive小文件过多问题的解决方法
发布时间
阅读量:
阅读量
文章目录
-
一、小型文件产生的主要原因
- 首先,直接注入表结构中的数据即属于此类情况
- 其次,在特定条件下执行加载操作可导入所需数据
- 最后,在查询结果基础上筛选出目标信息也被归为此类
-
二 小文件数量过多可能带来的负面影响
-
三 如何处理小文件数量过多的问题
-
1 使用Hive内置的concatenate命令实现自动合并小文件
-
2 通过优化配置参数来减少Map的数量
-
3.1 配置Map输入端相关参数以实现对小文件的整合
-
3.2 调整Map输出及Reduce输出阶段的整合设置
-
3.3 启用数据压缩技术以进一步优化存储效率
- 3、 减少Reduce的数量
- 4. 使用hadoop的archive将小文件归档
一、小文件产生原因
在Hive环境中处理的小规模的数据块必定是由于将这些数据导入到Hive表时产生的原因,因此建议先了解一下Hive中将数据导入的主要途径有哪些.
1、直接向表中插入数据
insert into table A values (1,'zhangsan',88),(2,'lisi',61);
每当该方式进行一次插入操作时都会生成相应的文件;当向系统中输入少量数据时会频繁地创建多个小文件;然而,在实际应用中这种方法的应用场景相对有限;可以说
全部评论 (0)
还没有任何评论哟~
