Advertisement

Hive | Python预处理、分析movielens数据集

阅读量:

概述

熟悉Hive的小伙伴都知道,在企业环境中对Hive进行数据预处理ETL的过程中,默认的主要使用UDF操作配合Python脚本实现效率最大化。本文旨在通过Python脚本在Hive中实施数据清洗方案,并提供相应的实践案例以供参考。数据集来源:http://files.grouplinks.org/datasets/movielens/

当然,下面的分析内容如果用spark,一句就搞定了。

需求分析

在ml-100k数据集中共有四个字段。具体来说,每个字段分别对应UserID、MovieID、Rating和ViewingTime等信息。例如,在这个数据集中我们可以看到前几条数据可展示如下图。

在这里插入图片描述

查看了数据后识别第四个字段time的呈现形式与我们日常使用的格式不一致,在数据分析过程中这种不规范的显示方式不利于后续分析工作。因此有必要对其进行数据预处理

原始表创建和导入数据

  • 通过Linux平台下载数据包:wget http://files.grouplens.org/datasets/movielens/ml-100k.zip

全部评论 (0)

还没有任何评论哟~