Advertisement

涉及Impala及其他大数据面试题中的其他查询组件

阅读量:

大数据面试题_Impala等查询组件(除Hive外的其它组件)

一、Impala技术解析

1、什么是Impala?

Cloudera公司推出的一款高效SQL查询工具名为Impala,能够实现实时的数据检索功能,根据官方测试结果,其运行效率较Hive提升了10至100倍,且在SQL查询速度方面甚至优于SparkSql,被誉为目前大数据领域中最为迅捷的查询工具;Impala依托于Hive架构,并采用内存计算方式,同时具备数据仓库的功能,兼具实时处理、批量处理以及多任务并发等优势。

2、 Impala与Hive的区别

(1) 相同点

Impala与Hive均属于基于Hadoop架构的数据查询工具,二者在功能定位上存在差异,适用于不同的应用场景。然而,从客户端的使用角度来看,两者在多个方面具有相似性,例如数据表的元数据管理、ODBC/JDBC驱动支持、SQL语法规范、文件格式的灵活性以及存储资源池的配置等。

(2)不同点

  • 执行计划

    1. Hive:该系统基于MapReduce执行框架,其执行流程被划分为map->shuffle->reduce->map->shuffle->reduce…的循环结构。当一个查询被转化为多个MapReduce任务时,会生成大量中间结果的写入操作。由于MapReduce本身

全部评论 (0)

还没有任何评论哟~