将数据迁移到Hadoop平台
发布时间
阅读量:
阅读量
目标:将Oracle数据库中的数据文件迁移至Hadoop平台,所涉及的数据表均包含上亿条记录,每个数据表的存储空间均超过100G。
关键点在于确保数据文件采用UTF8编码格式,如此才能在Hadoop环境中正确显示其中的汉字内容。
运行环境:CentOS 6.10
使用工具:Python 2.7以及cx_Oracle库
Oracle版本:10.2.0.4.0
Hadoop版本:2.7.2-transwarp-5.2.1
1. 检查数据表结构
若为分区表,则可直接按照分区进行数据导出;若为非分区表,则需分析索引字段,并依据索引字段对数据进行分段导出。
同时应记录对应的DDL语句,以便后续操作参考。
2. 编写Python脚本。
oralce_lib.py
# coding:utf-8
# 服务器上的Oracle接口
# By 陈年椰子
import cx_Oracle
import socket
import os
import time
os.environ['NLS_LANG'] = 'SIMPLIFIED CHINESE_CHINA.UTF8'
# 输出日志
def pro
全部评论 (0)
还没有任何评论哟~
