hadoop小文件处理(压缩技术方案)
发布时间
阅读量:
阅读量
小文件太多的问题:
每个hdfs文件都需要在其namenode上创建索引;由于众多的小文件会产生成百上千个索引;这不仅会导致namenode内存占用激增;而且随着索引数量急剧增加;检索效率也会显著下降
小文件解决方案:
1、hadoop自身提供一些文件压缩方案
通过系统层面的调整来解决现有hdfs的问题,并在此基础上进行小文件合并,并且之后建立高效的索引
下面分别对这两种解决方案做一些解析
1、hadoop自身提供一些文件压缩方案
hadoop对每个压缩格式的支持,详细见下表:
| 压缩格式 | 工具 | 算法 | 文件扩展名 | 多文件 | 可分割性 |
|---|---|---|---|---|---|
| DEFLATE | 无 | DEFLATE | .deflate | 不 | 不 |
| gzip | gzip | DEFLATE | .gz | 不 | 不 |
| ZIP | zip | DEFLATE | .zip | 是 | 是,在文件范围内 |
| bzip2 | bzip2 | bzip2 | .bz2 | 不 | 是 |
| LZO| lzop| LZO| .lzo| 不| 否
||
hadoop下各种压缩算法的压缩比,压缩时间,解压时间见下表:
| 压缩算法 | 原始文件大小 | 压缩后的文件大小 | 压缩速度 | 解压缩速度 |
|---|---|---|---|---|
| gzip | 8.3GB | 1.8GB | 17.5MB/s | 58MB/s |
| bzip |
全部评论 (0)
还没有任何评论哟~
