Hive | Python预处理、分析movielens数据集
发布时间
阅读量:
阅读量
概述
熟悉Hive的小伙伴都知道,在企业环境中对Hive进行数据预处理ETL的过程中,默认的主要使用UDF操作配合Python脚本实现效率最大化。本文旨在通过Python脚本在Hive中实施数据清洗方案,并提供相应的实践案例以供参考。数据集来源:http://files.grouplinks.org/datasets/movielens/
当然,下面的分析内容如果用spark,一句就搞定了。
需求分析
在ml-100k数据集中共有四个字段。具体来说,每个字段分别对应UserID、MovieID、Rating和ViewingTime等信息。例如,在这个数据集中我们可以看到前几条数据可展示如下图。

查看了数据后识别第四个字段time的呈现形式与我们日常使用的格式不一致,在数据分析过程中这种不规范的显示方式不利于后续分析工作。因此有必要对其进行数据预处理
原始表创建和导入数据
- 通过Linux平台下载数据包:
wget http://files.grouplens.org/datasets/movielens/ml-100k.zip - 通
全部评论 (0)
还没有任何评论哟~
