Advertisement

将数据迁移到Hadoop平台

阅读量:

目标:将Oracle数据库中的数据文件迁移至Hadoop平台,所涉及的数据表均包含上亿条记录,每个数据表的存储空间均超过100G。

关键点在于确保数据文件采用UTF8编码格式,如此才能在Hadoop环境中正确显示其中的汉字内容。

运行环境:CentOS 6.10

使用工具:Python 2.7以及cx_Oracle库

Oracle版本:10.2.0.4.0

Hadoop版本:2.7.2-transwarp-5.2.1

1. 检查数据表结构

若为分区表,则可直接按照分区进行数据导出;若为非分区表,则需分析索引字段,并依据索引字段对数据进行分段导出。

同时应记录对应的DDL语句,以便后续操作参考。

2. 编写Python脚本。

oralce_lib.py

复制代码
 # coding:utf-8

    
 # 服务器上的Oracle接口
    
 # By 陈年椰子
    
  
    
 import cx_Oracle
    
 import socket
    
 import os
    
 import time
    
  
    
 os.environ['NLS_LANG'] = 'SIMPLIFIED CHINESE_CHINA.UTF8'
    
  
    
  
    
 # 输出日志
    
 def pro

全部评论 (0)

还没有任何评论哟~