Advertisement

Hive的核心功能用于处理各种类型的数据

阅读量:

在前一篇文章中已经完成了hive的配置,现在需要利用hive来完成一些实际操作。这里有一组数据:https://raw.githubusercontent.com/ffzs/dataset/master/Questionnaire.csv,该数据来源于kaggle平台,是一份针对数据科学社区的调查问卷数据。需要注意的是,这份数据并非完整版本,仅选取了其中几列,原始数据包含超过200列:

接下来需要启动之前搭建好的hive集群
sh hive-start.sh
选择一个任意文件夹进行文件下载,只要自己能够记住路径即可:
wget https://raw.githubusercontent.com/ffzs/dataset/master/Questionnaire.csv
随后开启hive以及beeline工具:

复制代码
    schematool -dbType mysql -initSchema
    nohup hiveserver2 1>/home/hadoop/hiveserver.log 2>/home/hadoop/hiveserver.err &
    beeline -u jdbc:hive2://hadoop1:10000 -n root 
    
    
      
      
      
    

建立数

全部评论 (0)

还没有任何评论哟~