Hive和Kafka在数据稽核和同步中的应用
2021-07-01曹建华徐晨敏郭昱含
曹建华 徐晨敏 郭昱含



【摘要】 中国电信自主测评管理平台使用了Hadoop数据仓库工具Hive对基础数据进行合规性稽核,稽核后的数据通过Sqoop工具同步至Oracle关系数据库。针对多批次百万级数据量并行同步会导致Oracle负载过大影响正常OLTP的情况,通过应用Kafka消息队列,将Hive与Oracle之间的数据并行同步改为异步模式下可按需设置串行/并行同步,问题得到有效解决。
【关键词】 Hadoop Hive Sqoop Kafka
Application of hive and Kafka in data audit and synchronization
Cao jianhua, Xu chenmin, Guo yuhan(Customer service operation support center of China Telecom Group,Shanghai 200041)
Abstract:China Telecom independent evaluation management platform uses Hive which is a Hadoop data warehouse tool to audit the basic data, and the audited data is synchronized to Oracle relational database through sqoop tool. When multiple batches of millions of data are synchronized in parallel, Oracle load will be too large, which will affect the normal OLTP. By applying Kafka message queue, the data parallel synchronization between hive and Oracle can be changed to asynchronous mode, and either serial or parallel synchronization can be set on demand. The problem has been effectively solved.
Key words:Hadoop、Hive、Sqoop、Kafka
引言
中国电信自主测评管理平台用于支撑建立“客户说了算”的服务评价体系,负责对测评数据进行全流程管理,其中包括基础数据质量稽核和用户免打扰处理,以提升整体测评质量。用户免打扰处理是指对已标识的特殊用户不纳入测评,对曾经测评过的用户在一定期限内避免做二次测评。用户满意度测评分若干个指标,其中综合满意度测评单批次基础数据达百万级,为对基础数据进行高效的稽核,本平台采用了Hadoop分布式系统中的Hive数据仓库工具和oracle关系数据库相结合的技术方案,前者用于数据稽核和免打扰处理,后者用于存储稽核后的数据便于数据查询应用。
本文重点介绍采用Hive进行数据稽核及与Oracle之间进行数据同步的技术实现和优化方案。
一、技术方案
1.1技术方案选型
目前中国电信自主测评覆盖了公众、政企、触点、以及NPS等20多个指标,在对用户进行满意度测评前,需要对基础测评数据进行稽核、精准抽样,以提升整体测评质量。数据稽核和免打扰处理包括号码长度校验、是……
