APP下载

基于Spark的大数据清洗设计与研究

2018-08-09陈竹筠常玉红

科学与财富 2018年18期
关键词:大数据

陈竹筠 常玉红

摘要:大数据技术之中核心是数据分析,但在真正解决大数据问题之时,大部分工作基本都集中在数据清洗阶段,大数据清洗是大数据处理的基础。Spark作为当前最为流行的一种计算框架,能够将弹性分布式数据集,封装成大数据清洗的任务单位,通过组合,实现大数据清洗。文章将对基于Spark的大数据清洗框架设计进行研究和分析,希望能够对相关人员有所帮助。

关键词:大数据;清洗;框架;Spark

引言

目前,在我国开源内存分布式计算框架应用中最为流行的就是Spark,由于当前我国已经进入大数据时代,基于Hadoop的大数据工具已经无法满足当前的大数据处理需求,因此很多数据厂商也逐步转向在Spark上构建自己的内存分布式数据处理系统,从而为更多数据客户提供技术支持。大数据清洗是大数据分析的基础,能够提升数据质量,研究基于Spark的大数据清洗技术,对提升大数据处理质量有重要意义。

1基于Spark的大数据清洗框架介绍

基于Spark的大数据清洗框架核心主要是大数据清洗系统,其大数据操作单元是独立的Spark任务单元,单元功能从原始数据获取,直至高质量的清洁数据存入到大数据仓库,或者继续进行大数据分析。基于Spark的大数据清洗主要包括提取、转换、验证、装载等步骤,这些步骤各自含有一个或多个大数据清洗单元。

基于Spark的大数据清洗框架具有以下特性:第一,高处理性,该系统以RDD为数据封装对象,能够兼容不同的数据源,处理不同数据格式,有效解决了大数据多样性的问题;……

登录APP查看全文

猜你喜欢

大数据
基于在线教育的大数据研究
“互联网+”农产品物流业的大数据策略研究
基于大数据的小微电商授信评估研究
大数据时代新闻的新变化探究
浅谈大数据在出版业的应用
“互联网+”对传统图书出版的影响和推动作用
大数据环境下基于移动客户端的传统媒体转型思路
基于大数据背景下的智慧城市建设研究
数据+舆情:南方报业创新转型提高服务能力的探索