Advertisement

Hive学习之路(五):使用自定义函数UDF完成日志数据统计工作

阅读量:

内容简介

【一

  • 第三章 制定并使用自定义函数以完成日志数据分析工作

  • 步骤一:建立一个Java工程,并配置Maven作为构建工具

  • 步骤二:定义一个名为LogParser的类,并在其体内实现相应的功能

  • 步骤三:将开发所得的代码打包压缩,并通过版本控制系统提交到远程服务器

  • 步骤四:运行编译好的程序,在控制台中查看处理后的结果信息

    • 四、总结

一、Hive自定义函数UDF简介

在上一节中,我们介绍了多种Hive内建函数,并利用这些内建函数实现了WordCount功能.这些内建函数极大地提升了程序处理的效率.然而,在面对过于复杂的业务场景时, Hive 的内建函数往往难以应对.在ETL流程中,一个处理任务通常会包含多个子任务,每个子任务都需要处理较为复杂的数据.当用户无法自定义所需的具体处理逻辑时, 在业务实现上可能会遇到困难.因此,Hive系统提供了允许用户自定义功能模块的可能性.这一功能模块能够显著地增强用户的编程能力.它将被集成到现有的数据流中,并按照同样的方式执行计算操作.

二、数据准备

1.分析日志数据

27.19.74.143 - - [29/April/2016:17:38:20 +0800] “GET /static/image/common/faq

全部评论 (0)

还没有任何评论哟~