基于Spark的大数据清洗设计与研究
2018-08-09陈竹筠常玉红
科学与财富 2018年18期
关键词:大数据
陈竹筠 常玉红
摘要:大数据技术之中核心是数据分析,但在真正解决大数据问题之时,大部分工作基本都集中在数据清洗阶段,大数据清洗是大数据处理的基础。Spark作为当前最为流行的一种计算框架,能够将弹性分布式数据集,封装成大数据清洗的任务单位,通过组合,实现大数据清洗。文章将对基于Spark的大数据清洗框架设计进行研究和分析,希望能够对相关人员有所帮助。
关键词:大数据;清洗;框架;Spark
引言
目前,在我国开源内存分布式计算框架应用中最为流行的就是Spark,由于当前我国已经进入大数据时代,基于Hadoop的大数据工具已经无法满足当前的大数据处理需求,因此很多数据厂商也逐步转向在Spark上构建自己的内存分布式数据处理系统,从而为更多数据客户提供技术支持。大数据清洗是大数据分析的基础,能够提升数据质量,研究基于Spark的大数据清洗技术,对提升大数据处理质量有重要意义。
1基于Spark的大数据清洗框架介绍
基于Spark的大数据清洗框架核心主要是大数据清洗系统,其大数据操作单元是独立的Spark任务单元,单元功能从原始数据获取,直至高质量的清洁数据存入到大数据仓库,或者继续进行大数据分析。基于Spark的大数据清洗主要包括提取、转换、验证、装载等步骤,这些步骤各自含有一个或多个大数据清洗单元。
基于Spark的大数据清洗框架具有以下特性:第一,高处理性,该系统以RDD为数据封装对象,能够兼容不同的数据源,处理不同数据格式,有效解决了大数据多样性的问题;……
登录APP查看全文
